{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2026:5DDFABAWVJODPQO245KCCU7HG6","short_pith_number":"pith:5DDFABAW","schema_version":"1.0","canonical_sha256":"e8c6500416aa5c37c1dae7542153e737bbb9ee031c521f277e154d9bdc8f1b9a","source":{"kind":"arxiv","id":"2602.19313","version":2},"attestation_state":"computed","paper":{"title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.RO","authors_text":"Angela Jin Yang, Cole Harrison, Dieter Fox, Jiafei Duan, Lillian J. Ratliff, Ranjay Krishna, Shirui Chen, Ying-Chun Lee, Zhongzheng Ren","submitted_at":"2026-02-22T19:25:48Z","abstract_excerpt":"General-purpose robot learning requires dense, instruction-conditioned feedback that can distinguish meaningful task progress from stalled, failed, or partially completed behavior. Yet obtaining such feedback at scale remains difficult, since existing approaches often rely on manual progress annotations, task-specific demonstrations, or reward models trained on curated robot datasets. We introduce TOPReward, a training-free progress reward method that probes pretrained Video-Language Models (VLMs) through their internal token probabilities rather than asking them to generate numerical progress"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2602.19313","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.RO","submitted_at":"2026-02-22T19:25:48Z","cross_cats_sorted":["cs.AI","cs.LG"],"title_canon_sha256":"1e9783276940ead83dab259b8c4af22b5b8e41c11678e98a3e237344338f9129","abstract_canon_sha256":"ace27042cd1dd1f828a69c7e5d84d2bb1e693facda56cd18443f412e1a086653"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-24T00:23:07.629291Z","signature_b64":"Tw6LAhN8rQ45m0YIBCuDekATg5lDzNs/42+vQFmzXzyyXLnLw0lDj9CRxe806txGsrZtxGZG7y6LSzdcVtQmAA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"e8c6500416aa5c37c1dae7542153e737bbb9ee031c521f277e154d9bdc8f1b9a","last_reissued_at":"2026-07-24T00:23:07.628217Z","signature_status":"signed_v1","first_computed_at":"2026-07-24T00:23:07.628217Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"TOPReward: Token Probabilities as Hidden Zero-Shot Rewards for Robotics","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.LG"],"primary_cat":"cs.RO","authors_text":"Angela Jin Yang, Cole Harrison, Dieter Fox, Jiafei Duan, Lillian J. Ratliff, Ranjay Krishna, Shirui Chen, Ying-Chun Lee, Zhongzheng Ren","submitted_at":"2026-02-22T19:25:48Z","abstract_excerpt":"General-purpose robot learning requires dense, instruction-conditioned feedback that can distinguish meaningful task progress from stalled, failed, or partially completed behavior. Yet obtaining such feedback at scale remains difficult, since existing approaches often rely on manual progress annotations, task-specific demonstrations, or reward models trained on curated robot datasets. We introduce TOPReward, a training-free progress reward method that probes pretrained Video-Language Models (VLMs) through their internal token probabilities rather than asking them to generate numerical progress"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2602.19313","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2602.19313/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2602.19313","created_at":"2026-07-24T00:23:07.628701+00:00"},{"alias_kind":"arxiv_version","alias_value":"2602.19313v2","created_at":"2026-07-24T00:23:07.628701+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2602.19313","created_at":"2026-07-24T00:23:07.628701+00:00"},{"alias_kind":"pith_short_12","alias_value":"5DDFABAWVJOD","created_at":"2026-07-24T00:23:07.628701+00:00"},{"alias_kind":"pith_short_16","alias_value":"5DDFABAWVJODPQO2","created_at":"2026-07-24T00:23:07.628701+00:00"},{"alias_kind":"pith_short_8","alias_value":"5DDFABAW","created_at":"2026-07-24T00:23:07.628701+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":15,"internal_anchor_count":15,"sample":[{"citing_arxiv_id":"2607.05391","citing_title":"LLM-as-a-Verifier: A General-Purpose Verification Framework","ref_index":10,"is_internal_anchor":true},{"citing_arxiv_id":"2606.24742","citing_title":"World Value Models for Robotic Manipulation","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2606.24633","citing_title":"Beyond Monotonic Progress: Retry-Supervised Value Learning for Robot Imitation","ref_index":14,"is_internal_anchor":true},{"citing_arxiv_id":"2606.22027","citing_title":"RARM: Confidence-Gated Progress Reward Modeling for RL in Manipulation","ref_index":31,"is_internal_anchor":true},{"citing_arxiv_id":"2606.13675","citing_title":"Improving Robotic Generalist Policies via Flow Reversal Steering","ref_index":42,"is_internal_anchor":true},{"citing_arxiv_id":"2606.10305","citing_title":"SARM2: Multi-Task Stage Aware Reward Modeling for Self Improving Robotic Manipulation","ref_index":19,"is_internal_anchor":true},{"citing_arxiv_id":"2606.00267","citing_title":"StressDream: Steering Video World Models for Robust Policy Evaluation and Improvement","ref_index":120,"is_internal_anchor":true},{"citing_arxiv_id":"2606.28320","citing_title":"WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation","ref_index":36,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12369","citing_title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","ref_index":15,"is_internal_anchor":true},{"citing_arxiv_id":"2606.32027","citing_title":"Freeform Preference Learning for Robotic Manipulation","ref_index":6,"is_internal_anchor":true},{"citing_arxiv_id":"2605.30257","citing_title":"Stable-Layers: Fine-Tuning Image Layer Decomposition Models with VLM-Scored Reinforcement Learning","ref_index":4,"is_internal_anchor":true},{"citing_arxiv_id":"2605.22123","citing_title":"Beyond Pixels: Learning Invariant Rewards for Real-World Robotics From a Few Demonstrations","ref_index":8,"is_internal_anchor":true},{"citing_arxiv_id":"2603.02115","citing_title":"Robometer: Scaling General-Purpose Robotic Reward Models via Trajectory Comparisons","ref_index":50,"is_internal_anchor":true},{"citing_arxiv_id":"2605.12369","citing_title":"GuidedVLA: Specifying Task-Relevant Factors via Plug-and-Play Action Attention Specialization","ref_index":15,"is_internal_anchor":true},{"citing_arxiv_id":"2604.11751","citing_title":"Grounded World Model for Semantically Generalizable Planning","ref_index":12,"is_internal_anchor":true}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6","json":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6.json","graph_json":"https://pith.science/api/pith-number/5DDFABAWVJODPQO245KCCU7HG6/graph.json","events_json":"https://pith.science/api/pith-number/5DDFABAWVJODPQO245KCCU7HG6/events.json","paper":"https://pith.science/paper/5DDFABAW"},"agent_actions":{"view_html":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6","download_json":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6.json","view_paper":"https://pith.science/paper/5DDFABAW","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2602.19313&json=true","fetch_graph":"https://pith.science/api/pith-number/5DDFABAWVJODPQO245KCCU7HG6/graph.json","fetch_events":"https://pith.science/api/pith-number/5DDFABAWVJODPQO245KCCU7HG6/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6/action/timestamp_anchor","attest_storage":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6/action/storage_attestation","attest_author":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6/action/author_attestation","sign_citation":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6/action/citation_signature","submit_replication":"https://pith.science/pith/5DDFABAWVJODPQO245KCCU7HG6/action/replication_record"}},"created_at":"2026-07-24T00:23:07.628701+00:00","updated_at":"2026-07-24T00:23:07.628701+00:00"}