{"as_of":"2026-08-08T06:41:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:dfa3c12b10451e4d655380abc76a0ae3356c4ade5a8d3ce77e60a16c531c3a0b","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:23:17.808710Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-21T14:03:48.795572Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T14:04:11.986738Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- finevla: Reasoning-aware teacher-guided transfer fine- tuning","venue":null,"work_id":"9f1d6c60-32c9-4450-ac49-40dcef8d4dd9","year":2025},"citing_paper":{"arxiv_id":"2508.13073","last_updated":"2025-09-01T08:10:01Z","snapshot_observed_at":"2026-08-07T15:40:31.068428Z","submitted_at":"2025-08-18T16:45:48Z","title":"Large VLM-based Vision-Language-Action Models for Robotic Manipulation: A Survey","version":2},"reference_index":105,"source":"pdf_text","source_observed_at":"2026-05-17T20:28:15.818016Z"},"links":{"cited_paper":"/paper/2505.19080","citing_paper":"/paper/2508.13073"},"observation_digest":"sha256:4d2c2830b5acbe12a5565bfcc73ff9907f154dd49d46eadf1c6e66b1a73b7b23","observation_id":"bb9718ee-8092-4610-a8ed-ff793642f6d6","resolution":{"observed_at":"2026-05-17T20:28:16.100767Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.19080","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.19080","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Re- finevla: Reasoning-aware teacher-guided transfer fine- tuning","venue":null,"work_id":"9f1d6c60-32c9-4450-ac49-40dcef8d4dd9","year":2025},"citing_paper":{"arxiv_id":"2602.08167","last_updated":"2026-05-16T05:42:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-09T00:10:17Z","title":"Self-Supervised Bootstrapping of Action-Predictive Embodied Reasoning","version":2},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-21T14:03:48.795572Z"},"links":{"cited_paper":"/paper/2505.19080","citing_paper":"/paper/2602.08167"},"observation_digest":"sha256:c7178f104f666de534ba04faa8982a8c7003e2c6508dcd9af1b639b801990717","observation_id":"4ac42071-05db-4460-9fee-aaf2782b3f9e","resolution":{"observed_at":"2026-05-21T14:04:11.988479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.19080/citation-record","integrity":"/paper/2505.19080/integrity","json":"/paper/2505.19080/citation-record.json","paper":"/paper/2505.19080"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T14:23:17.623490Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.623490Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:996fe7b07a7f7002a8d4166634187a99fa8ddda96ba3677dd3594c6f0e9775f4","observation_id":"6abdc78f-71ff-44c2-8905-f41793a00c8d","resolution":{"observed_at":"2026-08-07T14:23:17.623490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.06817","last_updated":"2023-08-11T17:45:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-12-13T18:55:15Z","title":"RT-1: Robotics Transformer for Real-World Control at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.06817","snapshot_observed_at":"2026-08-07T14:23:17.633566Z","title":"Rt-1: Robotics transformer for real-world control at scale.arXiv preprint arXiv:2212.06817,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.633566Z"},"links":{"cited_paper":"/paper/2212.06817","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:9481ed11c7bdfadeb5aae70ec036c0a1ac6a5da68484f159eb9014b9e03b3ff1","observation_id":"81ff07c7-4efa-4727-b3df-307f7c407460","resolution":{"observed_at":"2026-08-07T14:23:17.633566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07775","last_updated":"2024-07-12T14:37:08Z","snapshot_observed_at":"2026-07-06T18:44:20.262496Z","submitted_at":"2024-07-10T15:49:07Z","title":"Mobility VLA: Multimodal Instruction Navigation with Long-Context VLMs and Topological Graphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07775","snapshot_observed_at":"2026-08-07T14:23:17.645992Z","title":"Mobility vla: Multimodal instruction navigation with long-context vlms and topological graphs.arXiv preprint arXiv:2407.07775,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.645992Z"},"links":{"cited_paper":"/paper/2407.07775","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:3a639661392170a4d2676dfb36b1a0c9b71a6ca31b9674a605b315b3fed22159","observation_id":"a4ad4753-659c-4dfb-9d7b-f3adf0084e78","resolution":{"observed_at":"2026-08-07T14:23:17.645992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.03378","last_updated":"2023-03-06T18:58:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-06T18:58:06Z","title":"PaLM-E: An Embodied Multimodal Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.03378","snapshot_observed_at":"2026-08-07T14:23:17.654955Z","title":"Palm-e: An embodied multimodal language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.654955Z"},"links":{"cited_paper":"/paper/2303.03378","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:c6e09f3006d5d26408fcf26019281ba46d1522311513a21626e400a52d634353","observation_id":"0e02cd66-b18e-404b-8600-30083f1a3b1d","resolution":{"observed_at":"2026-08-07T14:23:17.654955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.07280","last_updated":"2023-03-13T16:54:11Z","snapshot_observed_at":"2026-07-06T15:02:45.127825Z","submitted_at":"2023-03-13T16:54:11Z","title":"Vision-Language Models as Success Detectors","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.07280","snapshot_observed_at":"2026-08-07T14:23:17.659489Z","title":"Vision-language models as success detectors.arXiv preprint arXiv:2303.07280,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.659489Z"},"links":{"cited_paper":"/paper/2303.07280","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d5a5acdb8f48b14d036c21f41842031792ce25d056dc11734b77613b2fe6e1d3","observation_id":"f798f7a9-6ef4-483a-a5f6-c73656e14c01","resolution":{"observed_at":"2026-08-07T14:23:17.659489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.13396","last_updated":"2021-09-27T23:42:12Z","snapshot_observed_at":"2026-07-06T11:51:58.310046Z","submitted_at":"2021-09-27T23:42:12Z","title":"Bridge Data: Boosting Generalization of Robotic Skills with Cross-Domain Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.13396","snapshot_observed_at":"2026-08-07T14:23:17.663373Z","title":"Bridge data: Boosting generalization of robotic skills with cross-domain datasets.arXiv preprint arXiv:2109.13396,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.663373Z"},"links":{"cited_paper":"/paper/2109.13396","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4bce49965bd488dc78f2aa265ae99e36ef930d0ea007f26073ad07907d59d3d7","observation_id":"34381656-f7d4-40ae-8ed9-c7fecfa8b12c","resolution":{"observed_at":"2026-08-07T14:23:17.663373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10421","last_updated":"2022-12-14T14:28:33Z","snapshot_observed_at":"2026-08-02T18:21:56.310331Z","submitted_at":"2022-03-20T00:52:45Z","title":"CoWs on Pasture: Baselines and Benchmarks for Language-Driven Zero-Shot Object Navigation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10421","snapshot_observed_at":"2026-08-07T14:23:17.667521Z","title":"Clip on wheels: Zero-shot object navigation as object localization and exploration.arXiv preprint arXiv:2203.10421, 3(4):7,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.667521Z"},"links":{"cited_paper":"/paper/2203.10421","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:80d76d439cdc102c0d33f0288f7543357905b06188c4a9fc54bc203144c6257b","observation_id":"df46edfa-4461-4a4a-9c8f-5392f7ec3965","resolution":{"observed_at":"2026-08-07T14:23:17.667521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08573","last_updated":"2023-10-12T17:57:32Z","snapshot_observed_at":"2026-08-01T09:54:49.707557Z","submitted_at":"2023-10-12T17:57:32Z","title":"PolyTask: Learning Unified Policies through Behavior Distillation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08573","snapshot_observed_at":"2026-08-07T14:23:17.671649Z","title":"Polytask: Learning unified policies through behavior distillation.arXiv preprint arXiv:2310.08573,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.671649Z"},"links":{"cited_paper":"/paper/2310.08573","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:93af1b167ced34aa80ef77c65d3be104ce97ec077dc9e765f3765395d57d7ca1","observation_id":"464f69e0-2884-4d5f-b06d-0c4a029929cb","resolution":{"observed_at":"2026-08-07T14:23:17.671649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07539","last_updated":"2024-07-16T20:20:07Z","snapshot_observed_at":"2026-08-02T20:01:40.690381Z","submitted_at":"2024-06-11T17:58:54Z","title":"BAKU: An Efficient Transformer for Multi-Task Policy Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07539","snapshot_observed_at":"2026-08-07T14:23:17.675946Z","title":"Baku: An efficient transformer for multi-task policy learning.arXiv preprint arXiv:2406.07539,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.675946Z"},"links":{"cited_paper":"/paper/2406.07539","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:78fe7a2b6f8f689f6e7c3eb0f68393637a942a5fcf30613475f7911f682edb7a","observation_id":"732721b3-d6da-4340-8413-a7817eacb5dc","resolution":{"observed_at":"2026-08-07T14:23:17.675946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16187","last_updated":"2023-06-21T01:27:37Z","snapshot_observed_at":"2026-07-06T15:09:08.648296Z","submitted_at":"2023-03-28T17:53:06Z","title":"Visual Chain-of-Thought Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16187","snapshot_observed_at":"2026-08-07T14:23:17.680787Z","title":"Visual chain-of-thought diffusion models.arXiv preprint arXiv:2303.16187,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.680787Z"},"links":{"cited_paper":"/paper/2303.16187","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:b2bceb091c70ee6902502956e48d0743f2875052a903a9d8a39f3c76b6510635","observation_id":"4f894259-7a00-4310-8e45-b0d1b59a5a00","resolution":{"observed_at":"2026-08-07T14:23:17.680787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09403","last_updated":"2024-11-11T00:54:32Z","snapshot_observed_at":"2026-08-05T09:57:39.370124Z","submitted_at":"2024-06-13T17:59:31Z","title":"Visual Sketchpad: Sketching as a Visual Chain of Thought for Multimodal Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09403","snapshot_observed_at":"2026-08-07T14:23:17.684374Z","title":"Visual sketchpad: Sketching as a visual chain of thought for multimodal language models.arXiv preprint arXiv:2406.09403,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.684374Z"},"links":{"cited_paper":"/paper/2406.09403","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:913b4834582f99e8b24bd8bd9a7673851bb0dd4d083a4091bfb9624a4f5d8318","observation_id":"449c37bd-508f-4e8b-aefc-cdf5f7300e83","resolution":{"observed_at":"2026-08-07T14:23:17.684374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.22325","last_updated":"2024-10-30T03:33:08Z","snapshot_observed_at":"2026-07-06T19:41:46.397542Z","submitted_at":"2024-10-29T17:58:13Z","title":"Robots Pre-train Robots: Manipulation-Centric Robotic Representation from Large-Scale Robot Datasets","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.22325","snapshot_observed_at":"2026-08-07T14:23:17.688817Z","title":"Seil Kang, Jinyeong Kim, Junhyeok Kim, and Seong Jae Hwang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.688817Z"},"links":{"cited_paper":"/paper/2410.22325","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e461ac4c0fa9ae0cb4f1f1de3dd373f9e519fdb9b9c56b068fff8132746af849","observation_id":"f68abc9f-17c6-40c9-ac6d-91c14bfef0e8","resolution":{"observed_at":"2026-08-07T14:23:17.688817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.12945","last_updated":"2025-04-22T17:57:51Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-19T17:48:38Z","title":"DROID: A Large-Scale In-The-Wild Robot Manipulation Dataset","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.12945","snapshot_observed_at":"2026-08-07T14:23:17.697987Z","title":"Droid: A large-scale in-the-wild robot manipulation dataset.arXiv preprint arXiv:2403.12945,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.697987Z"},"links":{"cited_paper":"/paper/2403.12945","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e8854e0ee880da10e971975f0d540f3c716fb2813c76b87d0660dfee82bff814","observation_id":"2ce3cffe-52ae-46ca-985c-4375be85fe20","resolution":{"observed_at":"2026-08-07T14:23:17.697987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09246","last_updated":"2024-09-05T19:46:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-13T15:46:55Z","title":"OpenVLA: An Open-Source Vision-Language-Action Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09246","snapshot_observed_at":"2026-08-07T14:23:17.701901Z","title":"Openvla: An open-source vision-language-action model.arXiv preprint arXiv:2406.09246,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.701901Z"},"links":{"cited_paper":"/paper/2406.09246","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:00a9a854b09196b2908eea46a2d9205e6e85064f8ff5b361ad863aa4df78b968","observation_id":"eb2e8d9f-f844-4ab5-9b98-56a120dc7747","resolution":{"observed_at":"2026-08-07T14:23:17.701901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.19650","last_updated":"2024-11-29T12:06:03Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-29T12:06:03Z","title":"CogACT: A Foundational Vision-Language-Action Model for Synergizing Cognition and Action in Robotic Manipulation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.19650","snapshot_observed_at":"2026-08-07T14:23:17.706264Z","title":"Cogact: A foundational vision-language-action model for synergizing cognition and action in robotic manipulation.arXiv preprint arXiv:2411.19650, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.706264Z"},"links":{"cited_paper":"/paper/2411.19650","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d1893a0b0f749f5c099f38ce9b1d81312ab3b0966719612c6b5805bfd69a49ba","observation_id":"1f8a9f70-5f59-417f-a4ef-291ae7906ac5","resolution":{"observed_at":"2026-08-07T14:23:17.706264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07864","last_updated":"2025-03-01T08:57:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-10T12:33:46Z","title":"RDT-1B: a Diffusion Foundation Model for Bimanual Manipulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07864","snapshot_observed_at":"2026-08-07T14:23:17.710194Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.710194Z"},"links":{"cited_paper":"/paper/2410.07864","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:2e8aca22a916786acf8367278e7896e4a56a55b243fd125f3c8ed1433a4b38e9","observation_id":"f939fbf7-bea3-4119-93b2-2f97b0c106c6","resolution":{"observed_at":"2026-08-07T14:23:17.710194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:23:18.348717Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":"e50c6829-1261-4aa0-bad2-b46d0719c686","year":2023},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.714106Z"},"links":{"citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:77eb1cec334d6fffc818533bf61056892fb5e8f179e3ed27a0cefab970954ec2","observation_id":"e2705686-9c43-44d1-8d38-040becb0cff0","resolution":{"observed_at":"2026-08-07T14:23:18.354072Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17727","last_updated":"2024-09-26T10:56:35Z","snapshot_observed_at":"2026-08-04T23:59:19.375654Z","submitted_at":"2024-09-26T10:56:35Z","title":"Robotic-CLIP: Fine-tuning CLIP on Action Data for Robotic Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17727","snapshot_observed_at":"2026-08-07T14:23:17.722399Z","title":"Robotic-clip: Fine-tuning clip on action data for robotic applications.arXiv preprint arXiv:2409.17727,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.722399Z"},"links":{"cited_paper":"/paper/2409.17727","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:7e6b6cffa91f757411319f4ce29cd7ded2914478626c4ca84964c7824f7ef1e6","observation_id":"47b13651-ccda-4a27-a7c2-d9e08182f07d","resolution":{"observed_at":"2026-08-07T14:23:17.722399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.08864","last_updated":"2025-05-14T15:22:36Z","snapshot_observed_at":"2026-08-08T01:53:43.555672Z","submitted_at":"2023-10-13T05:20:40Z","title":"Open X-Embodiment: Robotic Learning Datasets and RT-X Models","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.08864","snapshot_observed_at":"2026-08-07T14:23:17.726703Z","title":"Open x-embodiment: Robotic learning datasets and rt-x models.arXiv preprint arXiv:2310.08864,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.726703Z"},"links":{"cited_paper":"/paper/2310.08864","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:4d399c5efce4d852a23cc0e36b9472670d19f7a1fac3074d9b4cb5d82f4df321","observation_id":"f5540d1b-c5c0-4ab7-a9aa-e0aa30e0bddf","resolution":{"observed_at":"2026-08-07T14:23:17.726703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06342","last_updated":"2016-02-22T19:59:40Z","snapshot_observed_at":"2026-08-02T01:15:11.394264Z","submitted_at":"2015-11-19T20:17:27Z","title":"Actor-Mimic: Deep Multitask and Transfer Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06342","snapshot_observed_at":"2026-08-07T14:23:17.730799Z","title":"Actor-mimic: Deep multitask and transfer reinforcement learning.arXiv preprint arXiv:1511.06342,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.730799Z"},"links":{"cited_paper":"/paper/1511.06342","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:9ec8da549c33092bfc078580b337d157e00e7041d5a802816e2ff31d8e3f9bdd","observation_id":"6efc98c3-ab27-43b0-86d3-fda8c37f72b6","resolution":{"observed_at":"2026-08-07T14:23:17.730799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02317","last_updated":"2024-01-23T02:29:35Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:58:29Z","title":"Visual Chain of Thought: Bridging Logical Gaps with Multimodal Infillings","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02317","snapshot_observed_at":"2026-08-07T14:23:17.734824Z","title":"URL https://openreview.net/forum?id=1ikK0kHjvj","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.734824Z"},"links":{"cited_paper":"/paper/2305.02317","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:59a0f94a1abb3d1eb096997e2649021c9c191ce9d2ae10ebabbb13e38a013de0","observation_id":"2747b5cd-31f1-4a9a-a7d0-9b27b197983b","resolution":{"observed_at":"2026-08-07T14:23:17.734824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06295","last_updated":"2016-01-07T18:43:03Z","snapshot_observed_at":"2026-07-06T04:37:06.738855Z","submitted_at":"2015-11-19T18:38:47Z","title":"Policy Distillation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1511.06295","snapshot_observed_at":"2026-08-07T14:23:17.738527Z","title":"Policy distillation.arXiv preprint arXiv:1511.06295,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.738527Z"},"links":{"cited_paper":"/paper/1511.06295","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ce73a4e15cc455935c5a2a1f9ea6e509bcd43cf62d42d0347eff3f3abbe7cbd6","observation_id":"5adf02a6-e384-4fb2-964c-fdf93d35de3d","resolution":{"observed_at":"2026-08-07T14:23:17.738527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.03555","last_updated":"2024-12-04T18:50:42Z","snapshot_observed_at":"2026-07-06T20:01:45.826971Z","submitted_at":"2024-12-04T18:50:42Z","title":"PaliGemma 2: A Family of Versatile VLMs for Transfer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.03555","snapshot_observed_at":"2026-08-07T14:23:17.746209Z","title":"Paligemma 2: A family of versatile vlms for transfer.arXiv preprint arXiv:2412.03555,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.746209Z"},"links":{"cited_paper":"/paper/2412.03555","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ecd576a18e8a0ca74e32c0581addb1b93ac5f52918263b337b2912e5ab5bd85e","observation_id":"63a3906c-1393-4116-9bfe-f4ec57ec465c","resolution":{"observed_at":"2026-08-07T14:23:17.746209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T14:23:17.750302Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.750302Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:e72e75804cea9df8106239560ec747bcdbf67305d14efb24fe8ffc3027ab1ffa","observation_id":"74739850-34ab-4ea3-8c45-e07ee46b4627","resolution":{"observed_at":"2026-08-07T14:23:17.750302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12213","last_updated":"2024-05-26T19:55:26Z","snapshot_observed_at":"2026-07-06T18:16:51.116432Z","submitted_at":"2024-05-20T17:57:01Z","title":"Octo: An Open-Source Generalist Robot Policy","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12213","snapshot_observed_at":"2026-08-07T14:23:17.753703Z","title":"Octo: An open-source generalist robot policy.arXiv preprint arXiv:2405.12213,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.753703Z"},"links":{"cited_paper":"/paper/2405.12213","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ffb9a07bad2ada46f2799ad56c80c7ae77a19cfd11c2779222d63e1162abad68","observation_id":"06a43a6d-020e-4438-9363-62748c11a39d","resolution":{"observed_at":"2026-08-07T14:23:17.753703Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14786","last_updated":"2025-02-20T18:08:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-20T18:08:29Z","title":"SigLIP 2: Multilingual Vision-Language Encoders with Improved Semantic Understanding, Localization, and Dense Features","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14786","snapshot_observed_at":"2026-08-07T14:23:17.757431Z","title":"Siglip 2: Multilingual vision-language encoders with improved semantic understanding, localization, and dense features.arXiv preprint arXiv:2502.14786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.757431Z"},"links":{"cited_paper":"/paper/2502.14786","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:10396afb6c31a32d75d09923b923ca91ffe6807801c18d670ad0468fa2f08cae","observation_id":"1dd2fbca-44e1-47df-b93f-9f3bd3db2c20","resolution":{"observed_at":"2026-08-07T14:23:17.757431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02632","last_updated":"2024-12-04T05:02:45Z","snapshot_observed_at":"2026-07-06T20:01:05.921085Z","submitted_at":"2024-12-03T18:01:45Z","title":"Scaling Image Tokenizers with Grouped Spherical Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02632","snapshot_observed_at":"2026-08-07T14:23:17.761176Z","title":"Scaling image tokenizers with grouped spherical quantization.arXiv preprint arXiv:2412.02632,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.761176Z"},"links":{"cited_paper":"/paper/2412.02632","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d5928a183ebebbd9a30a889338e04b721d19e8273e39b394d16486745d487db1","observation_id":"751f49b8-2ddb-48c1-a56f-b8b44856507e","resolution":{"observed_at":"2026-08-07T14:23:17.761176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-07T14:23:17.765456Z","title":"Finetuned language models are zero-shot learners.arXiv preprint arXiv:2109.01652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.765456Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:713272aaf272c6a06df65c2753628a1e44dd649b5ace0185c89882ea0fcbfab6","observation_id":"a6817d30-8ecb-421c-ac65-cbb44d0871c3","resolution":{"observed_at":"2026-08-07T14:23:17.765456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00025","last_updated":"2024-07-12T12:51:00Z","snapshot_observed_at":"2026-07-06T17:09:59.848387Z","submitted_at":"2023-12-28T23:34:43Z","title":"Any-point Trajectory Modeling for Policy Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00025","snapshot_observed_at":"2026-08-07T14:23:17.769007Z","title":"Any-point trajectory modeling for policy learning.arXiv preprint arXiv:2401.00025,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.769007Z"},"links":{"cited_paper":"/paper/2401.00025","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:492b10841f44ba71bba343d3e1342742337ca3ad20e4b37ca3b90e12bdb57ab1","observation_id":"e803ffe3-7a4b-411d-b8f0-17f275d7367a","resolution":{"observed_at":"2026-08-07T14:23:17.769007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12514","last_updated":"2025-05-13T11:02:20Z","snapshot_observed_at":"2026-08-07T15:12:56.367961Z","submitted_at":"2024-09-19T07:10:18Z","title":"TinyVLA: Towards Fast, Data-Efficient Vision-Language-Action Models for Robotic Manipulation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12514","snapshot_observed_at":"2026-08-07T14:23:17.773216Z","title":"Tinyvla: Towards fast, data-efficient vision-language-action models for robotic manipulation.arXiv preprint arXiv:2409.12514,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.773216Z"},"links":{"cited_paper":"/paper/2409.12514","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:70a747f5bc04a62768b8b3b2e856748088a054670f32f98116a7bf52e1b5e850","observation_id":"77f08789-8c5e-41c8-ad67-24caa287070c","resolution":{"observed_at":"2026-08-07T14:23:17.773216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.04429","last_updated":"2025-03-04T16:31:57Z","snapshot_observed_at":"2026-08-01T23:38:04.510222Z","submitted_at":"2024-09-06T17:49:56Z","title":"VILA-U: a Unified Foundation Model Integrating Visual Understanding and Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.04429","snapshot_observed_at":"2026-08-07T14:23:17.776758Z","title":"Vila-u: a unified foundation model integrating visual understanding and generation.arXiv preprint arXiv:2409.04429,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.776758Z"},"links":{"cited_paper":"/paper/2409.04429","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:eae400181cf41d3bed79025bf9a95c8a0c4e2eb35cd41dae8cdc410d3a0cf9b0","observation_id":"c42b772c-8e66-46b0-8eca-d5b3a52207da","resolution":{"observed_at":"2026-08-07T14:23:17.776758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04163","last_updated":"2025-03-06T07:25:36Z","snapshot_observed_at":"2026-08-07T17:25:41.485672Z","submitted_at":"2025-03-06T07:25:36Z","title":"VLA Model-Expert Collaboration for Bi-directional Manipulation Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04163","snapshot_observed_at":"2026-08-07T14:23:17.780804Z","title":"Vla model-expert collaboration for bi-directional manipulation learning.arXiv preprint arXiv:2503.04163,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.780804Z"},"links":{"cited_paper":"/paper/2503.04163","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:ad635e2f574ac40a737537dbdb0118b156c07b5bdcef0a428c72017e69e76e33","observation_id":"e86922d0-6845-4f13-9ce9-9b1da0ee9540","resolution":{"observed_at":"2026-08-07T14:23:17.780804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16582","last_updated":"2024-03-23T03:06:54Z","snapshot_observed_at":"2026-07-06T15:33:42.279377Z","submitted_at":"2023-05-26T02:15:09Z","title":"Beyond Chain-of-Thought, Effective Graph-of-Thought Reasoning in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16582","snapshot_observed_at":"2026-08-07T14:23:17.784034Z","title":"Beyond chain-of-thought, effective graph-of-thought reasoning in language models.arXiv preprint arXiv:2305.16582,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.784034Z"},"links":{"cited_paper":"/paper/2305.16582","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d1bee9ffaa1a03a1828c02d34199b111a14b24f23bf9371e5f7f039cbbde1753","observation_id":"2e81a8eb-70fc-4362-a9f2-5efee888717f","resolution":{"observed_at":"2026-08-07T14:23:17.784034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08693","last_updated":"2025-03-06T19:29:03Z","snapshot_observed_at":"2026-08-07T02:44:43.738657Z","submitted_at":"2024-07-11T17:31:01Z","title":"Robotic Control via Embodied Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08693","snapshot_observed_at":"2026-08-07T14:23:17.788422Z","title":"Michał Zawalski, William Chen, Karl Pertsch, Oier Mees, Chelsea Finn, and Sergey Levine","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.788422Z"},"links":{"cited_paper":"/paper/2407.08693","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d8e8f7ecbcf4e41c2944aa65d1601b83dfeb6fc6eb6d04e5a6ddd5900e2007c1","observation_id":"9fa874c3-ba79-4697-aacc-2bc1ee726740","resolution":{"observed_at":"2026-08-07T14:23:17.788422Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.03540","last_updated":"2024-11-05T22:42:41Z","snapshot_observed_at":"2026-08-03T15:00:11.392314Z","submitted_at":"2024-11-05T22:42:41Z","title":"VLA-3D: A Dataset for 3D Semantic Scene Understanding and Navigation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.03540","snapshot_observed_at":"2026-08-07T14:23:17.792745Z","title":"Vla-3d: A dataset for 3d semantic scene understanding and navigation.arXiv preprint arXiv:2411.03540,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.792745Z"},"links":{"cited_paper":"/paper/2411.03540","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:0dc7e95a4e02325512d5fa769d7b6c5ffc10185da5a359d1ef126adb1ef55cdf","observation_id":"9dd4cd40-e528-408a-997d-5924fa5503a6","resolution":{"observed_at":"2026-08-07T14:23:17.792745Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18867","last_updated":"2025-06-26T03:43:38Z","snapshot_observed_at":"2026-07-06T20:28:47.519113Z","submitted_at":"2025-01-31T03:20:09Z","title":"UP-VLA: A Unified Understanding and Prediction Model for Embodied Agent","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18867","snapshot_observed_at":"2026-08-07T14:23:17.797242Z","title":"Up-vla: A unified understanding and prediction model for embodied agent.arXiv preprint arXiv:2501.18867,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.797242Z"},"links":{"cited_paper":"/paper/2501.18867","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:a8ed696f31fdc45714fbe0db2d7355492b6d1472b9883f1271566ebc53e97294","observation_id":"19898cd3-2219-4907-9f3d-17d2f2cee578","resolution":{"observed_at":"2026-08-07T14:23:17.797242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.22020","last_updated":"2025-03-27T22:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-27T22:23:04Z","title":"CoT-VLA: Visual Chain-of-Thought Reasoning for Vision-Language-Action Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.22020","snapshot_observed_at":"2026-08-07T14:23:17.801227Z","title":"Cot-vla: Visual chain-of-thought reasoning for vision-language-action models.arXiv preprint arXiv:2503.22020,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.801227Z"},"links":{"cited_paper":"/paper/2503.22020","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:f3047f8001c4ba4130ec11e1fd7dbc27870b09da99af4b573050ea289b922856","observation_id":"82a2a3c5-831d-445c-bc07-8d6a2ec8beab","resolution":{"observed_at":"2026-08-07T14:23:17.801227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09631","last_updated":"2024-03-14T17:58:41Z","snapshot_observed_at":"2026-08-05T20:54:58.855446Z","submitted_at":"2024-03-14T17:58:41Z","title":"3D-VLA: A 3D Vision-Language-Action Generative World Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09631","snapshot_observed_at":"2026-08-07T14:23:17.804686Z","title":"3d-vla: A 3d vision-language-action generative world model.arXiv preprint arXiv:2403.09631, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.804686Z"},"links":{"cited_paper":"/paper/2403.09631","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:52f41aec24c89b7fd065f8004f1008d854e64b8eabff39308601e632dca26dfb","observation_id":"058a3be1-e52f-4b8d-b071-11be389466cb","resolution":{"observed_at":"2026-08-07T14:23:17.804686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14420","last_updated":"2025-02-21T07:28:36Z","snapshot_observed_at":"2026-08-07T18:02:28.809163Z","submitted_at":"2025-02-20T10:16:18Z","title":"ChatVLA: Unified Multimodal Understanding and Robot Control with Vision-Language-Action Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14420","snapshot_observed_at":"2026-08-07T14:23:17.808710Z","title":"Chatvla: Unified multimodal understanding and robot control with vision-language-action model.arXiv preprint arXiv:2502.14420,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.808710Z"},"links":{"cited_paper":"/paper/2502.14420","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:d59d75a126a1d75131858e31a102e6faf556dec4353971cb6938735d7442c376","observation_id":"9dc6f745-b6fe-4d6f-ac3e-d374ec8ffdc1","resolution":{"observed_at":"2026-08-07T14:23:17.808710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.16999","last_updated":"2024-11-04T05:50:56Z","snapshot_observed_at":"2026-07-06T17:50:18.017647Z","submitted_at":"2024-03-25T17:59:23Z","title":"Visual CoT: Advancing Multi-Modal Language Models with a Comprehensive Dataset and Benchmark for Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.16999","snapshot_observed_at":"2026-08-07T14:23:17.741887Z","title":"Visual cot: Unleashing chain-of-thought reasoning in multi-modal language models.arXiv preprint arXiv:2403.16999,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.741887Z"},"links":{"cited_paper":"/paper/2403.16999","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:f97d3e23c524a3cdb863213d074e72857eaa5a232d3c166343f7800d2bec0e42","observation_id":"04349354-9950-43b9-95f3-155cd4a789c1","resolution":{"observed_at":"2026-08-07T14:23:17.741887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15818","last_updated":"2023-07-28T21:18:02Z","snapshot_observed_at":"2026-08-02T16:17:50.621617Z","submitted_at":"2023-07-28T21:18:02Z","title":"RT-2: Vision-Language-Action Models Transfer Web Knowledge to Robotic Control","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.15818","snapshot_observed_at":"2026-08-07T14:23:17.637851Z","title":"Rt-2: Vision-language-action models transfer web knowledge to robotic control.arXiv preprint arXiv:2307.15818,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.637851Z"},"links":{"cited_paper":"/paper/2307.15818","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:78b63cdd15840aa4da3fbed8b3e02fbe1e2de393cc4800ac90acb068209f34b1","observation_id":"53c9bd92-c75e-4dad-a0c4-c6cf9dc6c2b7","resolution":{"observed_at":"2026-08-07T14:23:17.637851Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09277","last_updated":"2023-11-15T18:54:01Z","snapshot_observed_at":"2026-08-02T16:03:14.942403Z","submitted_at":"2023-11-15T18:54:01Z","title":"Contrastive Chain-of-Thought Prompting","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09277","snapshot_observed_at":"2026-08-07T14:23:17.641948Z","title":"Berkeley UR5 demonstration dataset","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.641948Z"},"links":{"cited_paper":"/paper/2311.09277","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:3d3b89652b9476e24f7c035658a8eed3223c93703a2ffe5118c8ecc0e4d2f3ee","observation_id":"157b6815-5214-4c55-bb3c-67d32e33cbfe","resolution":{"observed_at":"2026-08-07T14:23:17.641948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.24164","last_updated":"2026-01-08T17:01:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-31T17:22:30Z","title":"$\\pi_0$: A Vision-Language-Action Flow Model for General Robot Control","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.24164","snapshot_observed_at":"2026-08-07T14:23:17.629072Z","title":"A vision-language-action flow model for general robot control","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.629072Z"},"links":{"cited_paper":"/paper/2410.24164","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:908b194846fcca3bd18afc1473667e7c516a54b3b5a601b917dac56c4c4b68d1","observation_id":"0ac48349-8dc8-4599-a0cd-9548ee5be645","resolution":{"observed_at":"2026-08-07T14:23:17.629072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12766","last_updated":"2023-02-24T17:29:31Z","snapshot_observed_at":"2026-08-05T20:49:12.236475Z","submitted_at":"2023-02-24T17:29:31Z","title":"Language-Driven Representation Learning for Robotics","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12766","snapshot_observed_at":"2026-08-07T14:23:17.693241Z","title":"Language-driven representation learning for robotics.arXiv preprint arXiv:2302.12766,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T14:23:17.693241Z"},"links":{"cited_paper":"/paper/2302.12766","citing_paper":"/paper/2505.19080"},"observation_digest":"sha256:23fb042550a0c7afe4cbcc42056ae6dafbc1650cac5bd5ee47191d30e4c0ab06","observation_id":"ab5cc005-88f5-4826-bba1-c90262fd21d6","resolution":{"observed_at":"2026-08-07T14:23:17.693241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.19080","last_updated":"2025-05-25T10:24:44Z","latest_version":1,"primary_category":"cs.RO","snapshot_observed_at":"2026-08-07T19:17:36.336624Z","submitted_at":"2025-05-25T10:24:44Z","title":"ReFineVLA: Reasoning-Aware Teacher-Guided Transfer Fine-Tuning"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":1},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 2 inbound Pith citation observations for arXiv:2505.19080."}