{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:IIY3EMN5WVIVBURKQEPFHRSKLZ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"dbc0ce5cfe0d32879a85147c5ca7d31c1692c48e3962311c9c191363cb5e6bdf","cross_cats_sorted":["cs.AI","cs.CV","cs.LG"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2024-12-06T08:04:02Z","title_canon_sha256":"0defab7753fee7d0702f2f847c4ca62652cf5d1e1fe636cfdb624cf9e5e82284"},"schema_version":"1.0","source":{"id":"2412.04835","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2412.04835","created_at":"2026-07-05T09:45:24Z"},{"alias_kind":"arxiv_version","alias_value":"2412.04835v1","created_at":"2026-07-05T09:45:24Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2412.04835","created_at":"2026-07-05T09:45:24Z"},{"alias_kind":"pith_short_12","alias_value":"IIY3EMN5WVIV","created_at":"2026-07-05T09:45:24Z"},{"alias_kind":"pith_short_16","alias_value":"IIY3EMN5WVIVBURK","created_at":"2026-07-05T09:45:24Z"},{"alias_kind":"pith_short_8","alias_value":"IIY3EMN5","created_at":"2026-07-05T09:45:24Z"}],"graph_snapshots":[{"event_id":"sha256:baec1b69655722f0b8dc8d2b18af7c1364fdebe9b958e5dc80dfa49c1728f319","target":"graph","created_at":"2026-07-05T09:45:24Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2412.04835/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Visuomotor robot policies, increasingly pre-trained on large-scale datasets, promise significant advancements across robotics domains. However, aligning these policies with end-user preferences remains a challenge, particularly when the preferences are hard to specify. While reinforcement learning from human feedback (RLHF) has become the predominant mechanism for alignment in non-embodied domains like large language models, it has not seen the same success in aligning visuomotor policies due to the prohibitive amount of human feedback required to learn visual reward functions. To address this","authors_text":"Andrea Bajcsy, Chenfeng Xu, Jitendra Malik, Masayoshi Tomizuka, Ran Tian, Yilin Wu","cross_cats":["cs.AI","cs.CV","cs.LG"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2024-12-06T08:04:02Z","title":"Maximizing Alignment with Minimal Feedback: Efficiently Learning Rewards for Visuomotor Robot Policy Alignment"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2412.04835","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:f9ae22e2dab4dbd1979b242d05d889d8856dbe2209c3fc8802f25b10424d1b7e","target":"record","created_at":"2026-07-05T09:45:24Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"dbc0ce5cfe0d32879a85147c5ca7d31c1692c48e3962311c9c191363cb5e6bdf","cross_cats_sorted":["cs.AI","cs.CV","cs.LG"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2024-12-06T08:04:02Z","title_canon_sha256":"0defab7753fee7d0702f2f847c4ca62652cf5d1e1fe636cfdb624cf9e5e82284"},"schema_version":"1.0","source":{"id":"2412.04835","kind":"arxiv","version":1}},"canonical_sha256":"4231b231bdb55150d22a811e53c64a5e73fa9a2640cd19d183be709a5ed48008","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"4231b231bdb55150d22a811e53c64a5e73fa9a2640cd19d183be709a5ed48008","first_computed_at":"2026-07-05T09:45:24.438278Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T09:45:24.438278Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"MUfzIB4PUD6QTWmoDJaWMYmW1jrF7ojRpC9mEMNBS8pHWr/flbvbhM5n0lVegLP+UAUppfj6G1OuzosgNGhBCw==","signature_status":"signed_v1","signed_at":"2026-07-05T09:45:24.438788Z","signed_message":"canonical_sha256_bytes"},"source_id":"2412.04835","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:f9ae22e2dab4dbd1979b242d05d889d8856dbe2209c3fc8802f25b10424d1b7e","sha256:baec1b69655722f0b8dc8d2b18af7c1364fdebe9b958e5dc80dfa49c1728f319"],"state_sha256":"520db1e724c0c20c67d1ca9dd99e9eb7da30c7a99e950294807e26069300fb0e"}