{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:G7W5MR3AWEXRETUXTQ5HJBGUTX","short_pith_number":"pith:G7W5MR3A","schema_version":"1.0","canonical_sha256":"37edd64760b12f124e979c3a7484d49de2fe049b5df19558594d7c9f2513b22a","source":{"kind":"arxiv","id":"2505.07395","version":1},"attestation_state":"computed","paper":{"title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Donglin Wang, Han Zhao, Hongchao Lu, Hongyin Zhang, Pengxiang Ding, Zifeng Zhuang","submitted_at":"2025-05-12T09:48:03Z","abstract_excerpt":"Vision-Language-Action (VLA) models have shown great potential in general robotic decision-making tasks via imitation learning. However, the variable quality of training data often constrains the performance of these models. On the other hand, offline Reinforcement Learning (RL) excels at learning robust policy models from mixed-quality data. In this paper, we introduce Reinforced robot GPT (ReinboT), a novel end-to-end VLA model that integrates the RL principle of maximizing cumulative reward. ReinboT achieves a deeper understanding of the data quality distribution by predicting dense returns"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.07395","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T09:48:03Z","cross_cats_sorted":[],"title_canon_sha256":"80cc590671de51a2c3945f11f150341fe65af7f22893a38349357a1311f8e28d","abstract_canon_sha256":"8e32256b00f2d67d5e0ed878bb2ce3d2e023175768d522b16e77544ecb91bd8e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:01:47.286997Z","signature_b64":"7Ld/iQqhdU89yIS8CMwpG/0ztlDfikL7FJ0Y9wqAdir7Gceyr42Jgggt1g4Vl82BUUnUT5YE1pg9V6eZS66YDQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"37edd64760b12f124e979c3a7484d49de2fe049b5df19558594d7c9f2513b22a","last_reissued_at":"2026-07-05T11:01:47.286469Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:01:47.286469Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"ReinboT: Amplifying Robot Visual-Language Manipulation with Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Donglin Wang, Han Zhao, Hongchao Lu, Hongyin Zhang, Pengxiang Ding, Zifeng Zhuang","submitted_at":"2025-05-12T09:48:03Z","abstract_excerpt":"Vision-Language-Action (VLA) models have shown great potential in general robotic decision-making tasks via imitation learning. However, the variable quality of training data often constrains the performance of these models. On the other hand, offline Reinforcement Learning (RL) excels at learning robust policy models from mixed-quality data. In this paper, we introduce Reinforced robot GPT (ReinboT), a novel end-to-end VLA model that integrates the RL principle of maximizing cumulative reward. ReinboT achieves a deeper understanding of the data quality distribution by predicting dense returns"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.07395","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.07395/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.07395","created_at":"2026-07-05T11:01:47.286526+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.07395v1","created_at":"2026-07-05T11:01:47.286526+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.07395","created_at":"2026-07-05T11:01:47.286526+00:00"},{"alias_kind":"pith_short_12","alias_value":"G7W5MR3AWEXR","created_at":"2026-07-05T11:01:47.286526+00:00"},{"alias_kind":"pith_short_16","alias_value":"G7W5MR3AWEXRETUX","created_at":"2026-07-05T11:01:47.286526+00:00"},{"alias_kind":"pith_short_8","alias_value":"G7W5MR3A","created_at":"2026-07-05T11:01:47.286526+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":14,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2607.02431","citing_title":"WorldSample: Closed-loop Real-robot RL with World Modelling","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.06155","citing_title":"AffordanceVLA: A Vision-Language-Action Model Empowering Action Generation through Affordance-Aware Understanding","ref_index":79,"is_internal_anchor":false},{"citing_arxiv_id":"2606.02313","citing_title":"Towards Precise Intent-Aligned VLA Aerial Navigation via Expert-Guided GRPO","ref_index":32,"is_internal_anchor":false},{"citing_arxiv_id":"2606.29892","citing_title":"Trust Your Instincts: Confidence-Driven Test-Time RL for Vision-Language-Action Models","ref_index":46,"is_internal_anchor":false},{"citing_arxiv_id":"2602.09023","citing_title":"TwinRL: Digital Twin-Driven Reinforcement Learning for Real-World Robotic Manipulation","ref_index":67,"is_internal_anchor":false},{"citing_arxiv_id":"2605.17486","citing_title":"DyGRO-VLA: Cross-Task Scaling of Vision-Language-Action Models via Dynamic Grouped Residual Optimization","ref_index":128,"is_internal_anchor":false},{"citing_arxiv_id":"2510.12710","citing_title":"Reflection-Based Task Adaptation for Self-Improving VLA","ref_index":17,"is_internal_anchor":false},{"citing_arxiv_id":"2510.17640","citing_title":"RESample: A Robust Data Augmentation Framework via Exploratory Sampling for Robotic Manipulation","ref_index":15,"is_internal_anchor":false},{"citing_arxiv_id":"2507.04447","citing_title":"DreamVLA: A Vision-Language-Action Model Dreamed with Comprehensive World Knowledge","ref_index":61,"is_internal_anchor":false},{"citing_arxiv_id":"2601.07060","citing_title":"PALM: Progress-Aware Policy Learning via Affordance Reasoning for Long-Horizon Robotic Manipulation","ref_index":140,"is_internal_anchor":false},{"citing_arxiv_id":"2509.09674","citing_title":"SimpleVLA-RL: Scaling VLA Training via Reinforcement Learning","ref_index":40,"is_internal_anchor":false},{"citing_arxiv_id":"2604.28192","citing_title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","ref_index":57,"is_internal_anchor":false},{"citing_arxiv_id":"2605.10821","citing_title":"UniSteer: Unified Noise Steering for Efficient Human-Guided VLA Adaptation","ref_index":30,"is_internal_anchor":false},{"citing_arxiv_id":"2604.28192","citing_title":"LaST-R1: Reinforcing Robotic Manipulation via Adaptive Physical Latent Reasoning","ref_index":57,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX","json":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX.json","graph_json":"https://pith.science/api/pith-number/G7W5MR3AWEXRETUXTQ5HJBGUTX/graph.json","events_json":"https://pith.science/api/pith-number/G7W5MR3AWEXRETUXTQ5HJBGUTX/events.json","paper":"https://pith.science/paper/G7W5MR3A"},"agent_actions":{"view_html":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX","download_json":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX.json","view_paper":"https://pith.science/paper/G7W5MR3A","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.07395&json=true","fetch_graph":"https://pith.science/api/pith-number/G7W5MR3AWEXRETUXTQ5HJBGUTX/graph.json","fetch_events":"https://pith.science/api/pith-number/G7W5MR3AWEXRETUXTQ5HJBGUTX/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX/action/timestamp_anchor","attest_storage":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX/action/storage_attestation","attest_author":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX/action/author_attestation","sign_citation":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX/action/citation_signature","submit_replication":"https://pith.science/pith/G7W5MR3AWEXRETUXTQ5HJBGUTX/action/replication_record"}},"created_at":"2026-07-05T11:01:47.286526+00:00","updated_at":"2026-07-05T11:01:47.286526+00:00"}