{"as_of":"2026-08-06T01:52:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:317ce901955d2b6ca23033ba86cdf683ad26f686549958826197da944c79c14e","coverage":[{"denominator":47,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":47,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T12:15:09.566913Z","state":"measured"},{"denominator":47,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":47,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.07383/citation-record","integrity":"/paper/2606.07383/integrity","json":"/paper/2606.07383/citation-record.json","paper":"/paper/2606.07383"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-02T12:15:09.336165Z","title":"Qwen3-vl technical report.arXiv preprint arXiv:2511.21631, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.336165Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:3ad8cbe62a8f4ff934b0b6e55bc30bbc96b82b54addd999cfe5b934104f49cc3","observation_id":"f85d9cd5-eaf8-471d-be86-915be5b74006","resolution":{"observed_at":"2026-08-02T12:15:09.336165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07726","last_updated":"2024-10-10T17:28:23Z","snapshot_observed_at":"2026-08-05T10:06:10.880743Z","submitted_at":"2024-07-10T14:57:46Z","title":"PaliGemma: A versatile 3B VLM for transfer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07726","snapshot_observed_at":"2026-08-02T12:15:09.342615Z","title":"Paligemma: A versatile 3b vlm for transfer.arXiv preprint arXiv:2407.07726, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.342615Z"},"links":{"cited_paper":"/paper/2407.07726","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:e71e266d01af2465d8b86acc6faa1617dce3e8816662f39f8c088d46cc2005b5","observation_id":"1b157492-8518-4b89-bf36-4685b1381a01","resolution":{"observed_at":"2026-08-02T12:15:09.342615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14734","last_updated":"2025-03-27T02:52:43Z","snapshot_observed_at":"2026-08-02T04:15:31.100670Z","submitted_at":"2025-03-18T21:06:21Z","title":"GR00T N1: An Open Foundation Model for Generalist Humanoid Robots","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14734","snapshot_observed_at":"2026-08-02T12:15:09.347896Z","title":"Gr00t n1: An open foundation model for generalist humanoid robots.arXiv preprint arXiv:2503.14734, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.347896Z"},"links":{"cited_paper":"/paper/2503.14734","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:a8c58950d5f9d66972f3bf2b38c02f7e821d0d72b16c8fc6e2671c62a3aba62f","observation_id":"46a570ac-7d0e-491d-beaf-f2b860e3eab1","resolution":{"observed_at":"2026-08-02T12:15:09.347896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-02T12:15:09.353004Z","title":"π0: A vision-language-action flow model for general robot control.arXiv preprint arXiv:2410.24164, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.353004Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:771a9b5f749996f5367d18a29a41fbec1d6db1caa29732eb02458cbde1601e8e","observation_id":"8549f908-e22e-421b-a437-af7d6c251d48","resolution":{"observed_at":"2026-08-02T12:15:09.353004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-02T12:15:09.358086Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.358086Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:3863edf29d5707195394934e35c6a9ec872fe5d480cdced08471baaddda3940f","observation_id":"6754a7fa-62c6-48af-9237-55f9fb5d6db2","resolution":{"observed_at":"2026-08-02T12:15:09.358086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06669","last_updated":"2025-08-04T04:50:21Z","snapshot_observed_at":"2026-08-04T23:08:22.516431Z","submitted_at":"2025-03-09T15:40:29Z","title":"AgiBot World Colosseo: A Large-scale Manipulation Platform for Scalable and Intelligent Embodied Systems","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06669","snapshot_observed_at":"2026-08-02T12:15:09.364085Z","title":"Agibot world colosseo: A large-scale manipulation platform for scalable and intelligent embodied systems.arXiv preprint arXiv:2503.06669, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.364085Z"},"links":{"cited_paper":"/paper/2503.06669","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:691ed0395c3f06e3148c356cfaf386ec07d2af5b7159b12c0e2dea81f4a39802","observation_id":"c18b988e-134b-42da-8089-190817262859","resolution":{"observed_at":"2026-08-02T12:15:09.364085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.369485Z","title":"Internvla-a1: Unifying understanding, generation and action for robotic manipulation.arXiv preprint arXiv:2601.02456, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.369485Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:19d2717beb662b341f9cbe4460e889f853d1176cb882973fdd460ca4e174fb26","observation_id":"c62a179b-494d-401b-b76a-9b98accf7cc2","resolution":{"observed_at":"2026-08-02T12:15:09.369485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.21539","last_updated":"2025-06-26T17:55:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-26T17:55:40Z","title":"WorldVLA: Towards Autoregressive Action World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.21539","snapshot_observed_at":"2026-08-02T12:15:09.374191Z","title":"Worldvla: Towards autoregressive action world model.arXiv preprint arXiv:2506.21539, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.374191Z"},"links":{"cited_paper":"/paper/2506.21539","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:0cc8f3cfa0a26d1bcf5a0b7e367f983f3ff0db1647aa1b675c1ea5459441583d","observation_id":"fdecfc6a-8e6a-446d-91dc-00b6eef637f6","resolution":{"observed_at":"2026-08-02T12:15:09.374191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18565","last_updated":"2023-05-29T18:58:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-29T18:58:38Z","title":"PaLI-X: On Scaling up a Multilingual Vision and Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18565","snapshot_observed_at":"2026-08-02T12:15:09.379092Z","title":"Pali-x: On scaling up a multilingual vision and language model.arXiv preprint arXiv:2305.18565, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.379092Z"},"links":{"cited_paper":"/paper/2305.18565","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:938f43a8f535d812ebdb16e7ffa8805de6a87aa3985faa9a6729dee5c542e5d7","observation_id":"0339165c-18b8-4ff8-8641-4a542d32d281","resolution":{"observed_at":"2026-08-02T12:15:09.379092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.384064Z","title":"Diffusion policy: Visuomotor policy learning via action diffusion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.384064Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:99d1654a721d67a7ac4162ac96948252c71e4865d6086067735aed552dbd2390","observation_id":"6a27a30d-93ac-4229-834c-5fcf5b8ecad6","resolution":{"observed_at":"2026-08-02T12:15:09.384064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.389043Z","title":"Agibot world colosseum","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.389043Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:8c5d6dc2f100d3868773ceb6f95c752d6861cce4b71b591ca3cfa77f06a71b8b","observation_id":"b8c65e87-b356-4689-a999-e81c2cbeef2c","resolution":{"observed_at":"2026-08-02T12:15:09.389043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.393726Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness.Advances in neural information processing systems, 35:16344–16359, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.393726Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:75958de8309c2d030cf7d49eaa3f62cb3243f3daf3805d96f5f8af8460b61f37","observation_id":"5890a996-870d-490c-b5fe-700d87489b7a","resolution":{"observed_at":"2026-08-02T12:15:09.393726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-02T12:15:09.398034Z","title":"Palm-e: An embodied multimodal language model.arXiv preprint arXiv:2303.03378, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.398034Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:dfe962313fe89790c6ede9598aeca17c0139c4ba1528e1fb05fe0761717c45e1","observation_id":"62a74055-419e-4ad4-a31c-10404268722a","resolution":{"observed_at":"2026-08-02T12:15:09.398034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.402606Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.402606Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:6f63ccf128aaecf36e22a80d1a35727bb6e1f1a2c2606a2f2c1df9cca95d7818","observation_id":"4add70e0-04da-46d8-820b-255e1a8d653b","resolution":{"observed_at":"2026-08-02T12:15:09.402606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.19854","last_updated":"2025-04-28T14:47:34Z","snapshot_observed_at":"2026-08-04T19:02:40.317582Z","submitted_at":"2025-04-28T14:47:34Z","title":"NORA: A Small Open-Sourced Generalist Vision Language Action Model for Embodied Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.19854","snapshot_observed_at":"2026-08-02T12:15:09.406859Z","title":"Nora: A small open-sourced generalist vision language action model for embodied tasks.arXiv preprint arXiv:2504.19854, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.406859Z"},"links":{"cited_paper":"/paper/2504.19854","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:12afa1248a1caf4fe24f19e3ee4562a9d9b366e4c54f90703724deba930de32d","observation_id":"66daa49f-ac12-4508-84db-78194d6698bf","resolution":{"observed_at":"2026-08-02T12:15:09.406859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.411816Z","title":"Bc-z: Zero-shot task generalization with robotic imitation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.411816Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:0afd00b68d6290d557b79cddfa8b17cc8237b15a4eeaeecba99786bf880ba4ed","observation_id":"e3b952a0-8099-4706-a7a4-3be18757e86a","resolution":{"observed_at":"2026-08-02T12:15:09.411816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.417028Z","title":"Openvla: An open-source vision- language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.417028Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:c087284576c79580791576087b4a6b0671982ee23032ff225dfae4860c3806d6","observation_id":"9c8428fd-7ae8-4c9a-b3c1-9509c7ceccdc","resolution":{"observed_at":"2026-08-02T12:15:09.417028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14818","last_updated":"2025-01-20T18:40:47Z","snapshot_observed_at":"2026-07-06T20:25:49.871084Z","submitted_at":"2025-01-20T18:40:47Z","title":"Eagle 2: Building Post-Training Data Strategies from Scratch for Frontier Vision-Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14818","snapshot_observed_at":"2026-08-02T12:15:09.422092Z","title":"Eagle 2: Building post-training data strategies from scratch for frontier vision-language models.arXiv preprint arXiv:2501.14818, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.422092Z"},"links":{"cited_paper":"/paper/2501.14818","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:499d50ac95dadda249e21bc4157858249f15a25698d4f5c3e2c5f6cf81da3e48","observation_id":"eb234e85-e580-44b9-9b56-f51854879b04","resolution":{"observed_at":"2026-08-02T12:15:09.422092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.08485","snapshot_observed_at":"2026-08-02T12:15:09.427135Z","title":"Visual instruction tuning.arXiv preprint arXiv:2304.08485, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.427135Z"},"links":{"cited_paper":"/paper/2304.08485","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:841049a7e521ccc5e852f6f43d8189f5f4a439946562dcefb3f11e8dfff52794","observation_id":"cdb3f463-5f6e-4c87-844e-7ade4e4864f0","resolution":{"observed_at":"2026-08-02T12:15:09.427135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-02T12:15:09.433525Z","title":"Rdt-1b: A diffusion foundation model for bimanual manipulation.arXiv preprint arXiv:2410.07864, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.433525Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:b6234f064d87ad47a34a0349d221a89dd61404c931080747fbb112368464bd62","observation_id":"ed6e6823-5d97-4d9a-b30a-861c6559d724","resolution":{"observed_at":"2026-08-02T12:15:09.433525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21845","last_updated":"2025-03-20T09:16:05Z","snapshot_observed_at":"2026-07-06T19:41:24.411424Z","submitted_at":"2024-10-29T08:12:20Z","title":"Precise and Dexterous Robotic Manipulation via Human-in-the-Loop Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21845","snapshot_observed_at":"2026-08-02T12:15:09.439410Z","title":"Precise and dexterous robotic manipulation via human-in-the-loop reinforce- ment learning.arXiv preprint arXiv:2410.21845, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.439410Z"},"links":{"cited_paper":"/paper/2410.21845","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:f741ffa9370945cc7dc687987427a915ab4f3f849ae9e7a4a2e30b29f3c82b29","observation_id":"c6a2d310-74ff-4307-8a45-c20c6507ef3b","resolution":{"observed_at":"2026-08-02T12:15:09.439410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.444510Z","title":"GeForce RTX 4090: Graphics cards for gaming","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.444510Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:3cb23fe78554eff745c043cd470fc3e64d40cd3bc6e83a13c000393462ac16ec","observation_id":"4b9bfe49-bb9e-415a-8f43-f7ed64646af8","resolution":{"observed_at":"2026-08-02T12:15:09.444510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.454578Z","title":"Nvidia jetson agx orin series technical brief","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.454578Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:020908f7a1458b6248b92092ccfee68e5d4ca0061f9e69f2037cc9a7dc857ac3","observation_id":"1eb1fcb2-4d47-4ccf-a0cc-5f45a7074578","resolution":{"observed_at":"2026-08-02T12:15:09.454578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.459345Z","title":"GeForce RTX 5090: Graphics cards for gamers and creators","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.459345Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:df7cdbd8cee0132a04e94579f0ec87f15892727d4bcc845bd56b6d47b95063a6","observation_id":"b7541855-c7be-4084-93e1-2b54a7f338ed","resolution":{"observed_at":"2026-08-02T12:15:09.459345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.464938Z","title":"Nvidia jetson thor series modules data sheet","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.464938Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:aff281d96f2dd297627c5aa482be01602f93bd9e29214e42daf3c92b875670c5","observation_id":"c800819b-e533-4eee-94f9-ac8f0fe95c51","resolution":{"observed_at":"2026-08-02T12:15:09.464938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.469816Z","title":"Octo: An open-source generalist robot policy","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.469816Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:1c6d474acf90ee8606db901d91c9675d685c316ae37dabe180561cb3ad9442ab","observation_id":"f045e71a-6319-43bc-bb6f-a073ec597521","resolution":{"observed_at":"2026-08-02T12:15:09.469816Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-02T12:15:09.474592Z","title":"Open x- embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.474592Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:6c0b4cecdfc0077f0414b02daa6ce1a02f4c12869d93cfe2ceff4f67ab2c2c0b","observation_id":"753a2d10-196a-44dd-8c9a-070a7bd7ce75","resolution":{"observed_at":"2026-08-02T12:15:09.474592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.07193","last_updated":"2024-02-02T10:24:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-14T15:12:19Z","title":"DINOv2: Learning Robust Visual Features without Supervision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.07193","snapshot_observed_at":"2026-08-02T12:15:09.479090Z","title":"Dinov2: Learning robust visual features without supervision.arXiv preprint arXiv:2304.07193, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.479090Z"},"links":{"cited_paper":"/paper/2304.07193","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:cebff33d12f16deff993c59c723bac524fef0bccddeaee6043ddbe4cc2a95496","observation_id":"9fc8d728-4cd6-4b4a-a712-3af23e14269c","resolution":{"observed_at":"2026-08-02T12:15:09.479090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.484141Z","title":"Scalable diffusion models with transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.484141Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:c137309a3ff9e32ff9d33b3faa45c42ad3fd53e450df1e13fbc21da946fcfdb8","observation_id":"c813eb58-1f70-4a68-8403-88fc581f1e18","resolution":{"observed_at":"2026-08-02T12:15:09.484141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09747","last_updated":"2025-01-16T18:57:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T18:57:04Z","title":"FAST: Efficient Action Tokenization for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09747","snapshot_observed_at":"2026-08-02T12:15:09.488661Z","title":"Fast: Efficient action tokenization for vision-language-action models.arXiv preprint arXiv:2501.09747, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.488661Z"},"links":{"cited_paper":"/paper/2501.09747","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:b0747ab47403750957c65b431b02649f91132581035734c00239c65f157d814d","observation_id":"efb80ac1-3003-44b8-991d-c9f921acb8c8","resolution":{"observed_at":"2026-08-02T12:15:09.488661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.493160Z","title":"π0.5: A vision-language-action model with open-world generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.493160Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:9e39034748a2f2e466250444e93dae13908f20cddc0a4625471ec7485a18d3cb","observation_id":"f84725e9-35c1-45e5-827d-1e6a84e25804","resolution":{"observed_at":"2026-08-02T12:15:09.493160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.497561Z","title":"Spatialvla: Exploring spatial representations for visual-language-action model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.497561Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:782f70c783fec6797d8a0ad1eeef552e017b1dba015ca5ad2fe3719adaadf0ef","observation_id":"442ecfd3-46f5-4bc9-8d9b-a1e0360d801b","resolution":{"observed_at":"2026-08-02T12:15:09.497561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-02T12:15:09.501965Z","title":"Qwen2.5-vl technical report.arXiv preprint arXiv:2502.13923, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.501965Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:49f85aaa14451d2074df2c3b740c4a308f596e0b9c94a1445950f9c2959a8ebd","observation_id":"7d8007c3-5e28-41f6-ae83-c0baeacea111","resolution":{"observed_at":"2026-08-02T12:15:09.501965Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.506790Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.506790Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:791cc5d5bdbb15bc577f997d755bc10ddf62695f7d9c9f4d1ed1d3414bb9955d","observation_id":"b7be3610-dc9d-4c00-b8ca-c7c833c46e58","resolution":{"observed_at":"2026-08-02T12:15:09.506790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.511264Z","title":"Multimodal diffusion transformer: Learning versatile behavior from multimodal goals","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.511264Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:79d3bd1f349d0de11b3de708f5ff85c5b6cf2b090233e86184bf5dd68eae16e1","observation_id":"64502435-484c-4f28-92d8-d365d88ab92c","resolution":{"observed_at":"2026-08-02T12:15:09.511264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.01844","last_updated":"2025-06-02T16:30:19Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-02T16:30:19Z","title":"SmolVLA: A Vision-Language-Action Model for Affordable and Efficient Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.01844","snapshot_observed_at":"2026-08-02T12:15:09.516498Z","title":"Smolvla: A vision-language-action model for affordable and efficient robotics.arXiv preprint arXiv:2506.01844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.516498Z"},"links":{"cited_paper":"/paper/2506.01844","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:a636d5f4eb2cfed6ab06a04f11585d535a0e343423b7c097cb5f668c6415b562","observation_id":"9fce9bf0-f028-4b89-90a0-666dd13f7d32","resolution":{"observed_at":"2026-08-02T12:15:09.516498Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.521411Z","title":"Agibot world 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.521411Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:e77e14180be1deefbdec6e12faf473a875415603b4fc48150ec8c65da86831a1","observation_id":"05b0731e-5b0f-43a3-ac62-578905f6c4c5","resolution":{"observed_at":"2026-08-02T12:15:09.521411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-02T11:57:18.735747Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-02T12:15:09.528450Z","title":"Llama 2: Open foundation and fine-tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.528450Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:aecc4642358e90cde9d033956823c5b66a37c542de2b455cbcbd23375d1c26d0","observation_id":"788afc40-a1c9-4434-8712-b536a3c37a23","resolution":{"observed_at":"2026-08-02T12:15:09.528450Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-02T12:15:09.533201Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.533201Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:99396a87c57b25209ee1070db43d3f6202ea1aa6be92084420cd5232b87c23bb","observation_id":"dba5a7a1-9390-41cf-9a45-784138885758","resolution":{"observed_at":"2026-08-02T12:15:09.533201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05855","last_updated":"2025-08-09T10:58:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-09T11:25:56Z","title":"DexVLA: Vision-Language Model with Plug-In Diffusion Expert for General Robot Control","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05855","snapshot_observed_at":"2026-08-02T12:15:09.538370Z","title":"Dexvla: Vision-language model with plug-in diffusion expert for general robot control.arXiv preprint arXiv:2502.05855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.538370Z"},"links":{"cited_paper":"/paper/2502.05855","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:3d2445fbe1c7899cf889d9d8ad00d96fc8655abe4e1c900bed4a467da8d6534b","observation_id":"2ced6296-28c5-4b81-8727-6fa822b89067","resolution":{"observed_at":"2026-08-02T12:15:09.538370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.18692","last_updated":"2026-02-26T03:30:01Z","snapshot_observed_at":"2026-08-03T03:53:18.422734Z","submitted_at":"2026-01-26T17:08:04Z","title":"A Pragmatic VLA Foundation Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.18692","snapshot_observed_at":"2026-08-02T12:15:09.543286Z","title":"A pragmatic vla foundation model.arXiv preprint arXiv:2601.18692, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.543286Z"},"links":{"cited_paper":"/paper/2601.18692","citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:128a67b8dad51c925188995544ca5a325028c8311c88d557731657f10824b8f8","observation_id":"686b84d6-eb90-48e1-924b-9ca2b66b3f81","resolution":{"observed_at":"2026-08-02T12:15:09.543286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.548343Z","title":"Sigmoid loss for language image pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.548343Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:d148f88609fd522bfa656ff599f20e17a6ca10082548c57a40ddce40b5d6afce","observation_id":"4094ad08-12fa-48c1-85e5-dc2217fe5fe4","resolution":{"observed_at":"2026-08-02T12:15:09.548343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.552785Z","title":"Root mean square layer normalization.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.552785Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:fefa5e8f8babaa3f48722a293e8871b3a03a58a5721ab25eab41fa548c735a83","observation_id":"10ec69e8-d3e5-40d6-a375-9cb4944b20f8","resolution":{"observed_at":"2026-08-02T12:15:09.552785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.557770Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language- action models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.557770Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:10b224be0d42a66d4c80021bb85bd35997f93c02bfd4d76cb8a8ebbd7c98f9de","observation_id":"dc2be4b3-88aa-4430-8ef4-e5c852eac8fa","resolution":{"observed_at":"2026-08-02T12:15:09.557770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.562074Z","title":"Tracevla: Visual trace prompting enhances spatial-temporal awareness for generalist robotic policies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.562074Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:76fcf8dae1fffdf40f8cab4609af7f754a0fa4a496ef20cd1f30ed0c10b275bf","observation_id":"e85b27e7-8d09-44e7-999b-2b25b546de2f","resolution":{"observed_at":"2026-08-02T12:15:09.562074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.566913Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.566913Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:291d76a319e18c442f3fb9df5db53bb5e21afa9d1c0584e9cca4c49bd8155792","observation_id":"707fd63c-029b-419f-af74-9a6a6d1d247f","resolution":{"observed_at":"2026-08-02T12:15:09.566913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T12:15:09.450087Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report","version":4},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T12:15:09.450087Z"},"links":{"citing_paper":"/paper/2606.07383"},"observation_digest":"sha256:0fbb7e9048ad84703c889f1e460ad4621dc7d37103be94dbd31300390f3e9478","observation_id":"3d824208-7385-4a3b-bbdc-39c9492e8242","resolution":{"observed_at":"2026-08-02T12:15:09.450087Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.07383","last_updated":"2026-07-17T05:50:11Z","latest_version":4,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-02T12:15:07.996580Z","submitted_at":"2026-06-05T15:21:41Z","title":"RhinoVLA Technical Report"},"reference_resolution":{"displayed":47,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":46,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":47},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 47 of 47 outbound references and 0 inbound Pith citation observations for arXiv:2606.07383."}