{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:G4WWGBLJFWW5PREVS4TPWM5A2K","short_pith_number":"pith:G4WWGBLJ","schema_version":"1.0","canonical_sha256":"372d6305692dadd7c4959726fb33a0d2939560fa208e935aff45913722032a25","source":{"kind":"arxiv","id":"2505.19767","version":1},"attestation_state":"computed","paper":{"title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Junyang Shu, Yongtao Wang, Zhiwei Lin","submitted_at":"2025-05-26T09:50:15Z","abstract_excerpt":"Vision-Language-Action (VLA) models have demonstrated significant potential in the field of embodied intelligence, enabling agents to follow human instructions to complete complex tasks in physical environments. Existing embodied agents are often trained through behavior cloning, which requires expensive data and computational resources and is constrained by human demonstrations. To address this issue, many researchers explore the application of reinforcement fine-tuning to embodied agents. However, typical reinforcement fine-tuning methods for embodied agents usually rely on sparse, outcome-b"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2505.19767","kind":"arxiv","version":1},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2025-05-26T09:50:15Z","cross_cats_sorted":[],"title_canon_sha256":"005ec478aff873f20d71b6143e126704d579fdb53fb668d69642070c312478fc","abstract_canon_sha256":"f963b68a7bc3553cbf9632b00f4d1e75d4cb028611d049a5c15f88c2974c069e"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:09:35.812699Z","signature_b64":"fMpmJTbW38WI++OXRkzOI79Y2hn0QZWPplqrE0TLucvy8+xS2ga15V0+p+yqKqLanwGjqKpEFR/mi1wsdFnrAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"372d6305692dadd7c4959726fb33a0d2939560fa208e935aff45913722032a25","last_reissued_at":"2026-07-05T11:09:35.812204Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:09:35.812204Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"RFTF: Reinforcement Fine-tuning for Embodied Agents with Temporal Feedback","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":[],"primary_cat":"cs.RO","authors_text":"Junyang Shu, Yongtao Wang, Zhiwei Lin","submitted_at":"2025-05-26T09:50:15Z","abstract_excerpt":"Vision-Language-Action (VLA) models have demonstrated significant potential in the field of embodied intelligence, enabling agents to follow human instructions to complete complex tasks in physical environments. Existing embodied agents are often trained through behavior cloning, which requires expensive data and computational resources and is constrained by human demonstrations. To address this issue, many researchers explore the application of reinforcement fine-tuning to embodied agents. However, typical reinforcement fine-tuning methods for embodied agents usually rely on sparse, outcome-b"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.19767","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.19767/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2505.19767","created_at":"2026-07-05T11:09:35.812262+00:00"},{"alias_kind":"arxiv_version","alias_value":"2505.19767v1","created_at":"2026-07-05T11:09:35.812262+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.19767","created_at":"2026-07-05T11:09:35.812262+00:00"},{"alias_kind":"pith_short_12","alias_value":"G4WWGBLJFWW5","created_at":"2026-07-05T11:09:35.812262+00:00"},{"alias_kind":"pith_short_16","alias_value":"G4WWGBLJFWW5PREV","created_at":"2026-07-05T11:09:35.812262+00:00"},{"alias_kind":"pith_short_8","alias_value":"G4WWGBLJ","created_at":"2026-07-05T11:09:35.812262+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K","json":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K.json","graph_json":"https://pith.science/api/pith-number/G4WWGBLJFWW5PREVS4TPWM5A2K/graph.json","events_json":"https://pith.science/api/pith-number/G4WWGBLJFWW5PREVS4TPWM5A2K/events.json","paper":"https://pith.science/paper/G4WWGBLJ"},"agent_actions":{"view_html":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K","download_json":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K.json","view_paper":"https://pith.science/paper/G4WWGBLJ","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2505.19767&json=true","fetch_graph":"https://pith.science/api/pith-number/G4WWGBLJFWW5PREVS4TPWM5A2K/graph.json","fetch_events":"https://pith.science/api/pith-number/G4WWGBLJFWW5PREVS4TPWM5A2K/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K/action/timestamp_anchor","attest_storage":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K/action/storage_attestation","attest_author":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K/action/author_attestation","sign_citation":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K/action/citation_signature","submit_replication":"https://pith.science/pith/G4WWGBLJFWW5PREVS4TPWM5A2K/action/replication_record"}},"created_at":"2026-07-05T11:09:35.812262+00:00","updated_at":"2026-07-05T11:09:35.812262+00:00"}