{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:B23PMO5YRDOMXUOBQOK35UA6HX","short_pith_number":"pith:B23PMO5Y","canonical_record":{"source":{"id":"2501.08259","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-01-14T17:15:27Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"6e240af7f54a22864ee531391d12f8ab4564ded77d6b4f884b2e14d13fd12b7a","abstract_canon_sha256":"3cae00b50971bb7b42f95fdd473b1076fb49054166ec88b9597668b373f03780"},"schema_version":"1.0"},"canonical_sha256":"0eb6f63bb888dccbd1c18395bed01e3df4db230df5b342a5d96f0b487ba43d43","source":{"kind":"arxiv","id":"2501.08259","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.08259","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"arxiv_version","alias_value":"2501.08259v1","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.08259","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_12","alias_value":"B23PMO5YRDOM","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_16","alias_value":"B23PMO5YRDOMXUOB","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_8","alias_value":"B23PMO5Y","created_at":"2026-07-05T10:00:58Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:B23PMO5YRDOMXUOBQOK35UA6HX","target":"record","payload":{"canonical_record":{"source":{"id":"2501.08259","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-01-14T17:15:27Z","cross_cats_sorted":["cs.LG"],"title_canon_sha256":"6e240af7f54a22864ee531391d12f8ab4564ded77d6b4f884b2e14d13fd12b7a","abstract_canon_sha256":"3cae00b50971bb7b42f95fdd473b1076fb49054166ec88b9597668b373f03780"},"schema_version":"1.0"},"canonical_sha256":"0eb6f63bb888dccbd1c18395bed01e3df4db230df5b342a5d96f0b487ba43d43","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:00:58.569919Z","signature_b64":"tXokfsabiFmT8rECKNnrLbw2OwbYtSItwd5N/agxjrtcZk/4sQ52pedcAHfvUp1ctA/Zc5INSHuwVK/A37WkBw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"0eb6f63bb888dccbd1c18395bed01e3df4db230df5b342a5d96f0b487ba43d43","last_reissued_at":"2026-07-05T10:00:58.569491Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:00:58.569491Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2501.08259","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:00:58Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"AIxOdf+nDNL9oU5IhJaOUC/1A46mVEAwmZbzThw9dTu5IfQcULw6rm5onTfpsv7BGFp/pVx2a5FzRnStVlaUBQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-20T01:50:21.143582Z"},"content_sha256":"bd35806721ab7791ab052fed0f5227a01b3c9c336ecfe39e11a10902eb4f7525","schema_version":"1.0","event_id":"sha256:bd35806721ab7791ab052fed0f5227a01b3c9c336ecfe39e11a10902eb4f7525"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:B23PMO5YRDOMXUOBQOK35UA6HX","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"FDPP: Fine-tune Diffusion Policy with Human Preference","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG"],"primary_cat":"cs.RO","authors_text":"Devesh K. Jha, Diego Romeres, Masayoshi Tomizuka, Yuxin Chen","submitted_at":"2025-01-14T17:15:27Z","abstract_excerpt":"Imitation learning from human demonstrations enables robots to perform complex manipulation tasks and has recently witnessed huge success. However, these techniques often struggle to adapt behavior to new preferences or changes in the environment. To address these limitations, we propose Fine-tuning Diffusion Policy with Human Preference (FDPP). FDPP learns a reward function through preference-based learning. This reward is then used to fine-tune the pre-trained policy with reinforcement learning (RL), resulting in alignment of pre-trained policy with new human preferences while still solving "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.08259","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.08259/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:00:58Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"tsmwJefDxsl3033jXUW/aSWLH/psGYP/9vDz+1tPAzoCp2igQQ/AePiv2/QAIIwZxkraZ/Y6oNJ2UYmS2xsGDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-20T01:50:21.144267Z"},"content_sha256":"ce743f058a2daad640242e9267faf59a3568aff300934873f0cc9723cf6a3280","schema_version":"1.0","event_id":"sha256:ce743f058a2daad640242e9267faf59a3568aff300934873f0cc9723cf6a3280"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/B23PMO5YRDOMXUOBQOK35UA6HX/bundle.json","state_url":"https://pith.science/pith/B23PMO5YRDOMXUOBQOK35UA6HX/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/B23PMO5YRDOMXUOBQOK35UA6HX/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-20T01:50:21Z","links":{"resolver":"https://pith.science/pith/B23PMO5YRDOMXUOBQOK35UA6HX","bundle":"https://pith.science/pith/B23PMO5YRDOMXUOBQOK35UA6HX/bundle.json","state":"https://pith.science/pith/B23PMO5YRDOMXUOBQOK35UA6HX/state.json","well_known_bundle":"https://pith.science/.well-known/pith/B23PMO5YRDOMXUOBQOK35UA6HX/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:B23PMO5YRDOMXUOBQOK35UA6HX","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"3cae00b50971bb7b42f95fdd473b1076fb49054166ec88b9597668b373f03780","cross_cats_sorted":["cs.LG"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-01-14T17:15:27Z","title_canon_sha256":"6e240af7f54a22864ee531391d12f8ab4564ded77d6b4f884b2e14d13fd12b7a"},"schema_version":"1.0","source":{"id":"2501.08259","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.08259","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"arxiv_version","alias_value":"2501.08259v1","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.08259","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_12","alias_value":"B23PMO5YRDOM","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_16","alias_value":"B23PMO5YRDOMXUOB","created_at":"2026-07-05T10:00:58Z"},{"alias_kind":"pith_short_8","alias_value":"B23PMO5Y","created_at":"2026-07-05T10:00:58Z"}],"graph_snapshots":[{"event_id":"sha256:ce743f058a2daad640242e9267faf59a3568aff300934873f0cc9723cf6a3280","target":"graph","created_at":"2026-07-05T10:00:58Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2501.08259/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Imitation learning from human demonstrations enables robots to perform complex manipulation tasks and has recently witnessed huge success. However, these techniques often struggle to adapt behavior to new preferences or changes in the environment. To address these limitations, we propose Fine-tuning Diffusion Policy with Human Preference (FDPP). FDPP learns a reward function through preference-based learning. This reward is then used to fine-tune the pre-trained policy with reinforcement learning (RL), resulting in alignment of pre-trained policy with new human preferences while still solving ","authors_text":"Devesh K. Jha, Diego Romeres, Masayoshi Tomizuka, Yuxin Chen","cross_cats":["cs.LG"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-01-14T17:15:27Z","title":"FDPP: Fine-tune Diffusion Policy with Human Preference"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.08259","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:bd35806721ab7791ab052fed0f5227a01b3c9c336ecfe39e11a10902eb4f7525","target":"record","created_at":"2026-07-05T10:00:58Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"3cae00b50971bb7b42f95fdd473b1076fb49054166ec88b9597668b373f03780","cross_cats_sorted":["cs.LG"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-01-14T17:15:27Z","title_canon_sha256":"6e240af7f54a22864ee531391d12f8ab4564ded77d6b4f884b2e14d13fd12b7a"},"schema_version":"1.0","source":{"id":"2501.08259","kind":"arxiv","version":1}},"canonical_sha256":"0eb6f63bb888dccbd1c18395bed01e3df4db230df5b342a5d96f0b487ba43d43","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"0eb6f63bb888dccbd1c18395bed01e3df4db230df5b342a5d96f0b487ba43d43","first_computed_at":"2026-07-05T10:00:58.569491Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:00:58.569491Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"tXokfsabiFmT8rECKNnrLbw2OwbYtSItwd5N/agxjrtcZk/4sQ52pedcAHfvUp1ctA/Zc5INSHuwVK/A37WkBw==","signature_status":"signed_v1","signed_at":"2026-07-05T10:00:58.569919Z","signed_message":"canonical_sha256_bytes"},"source_id":"2501.08259","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:bd35806721ab7791ab052fed0f5227a01b3c9c336ecfe39e11a10902eb4f7525","sha256:ce743f058a2daad640242e9267faf59a3568aff300934873f0cc9723cf6a3280"],"state_sha256":"2ee283cc4bfb49f89af7e72a4a8386e49bee06a6ea58b8302da23885a9f96685"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"NDjEf6u1GZwmjnBp0wSjZDHs76GQns1ozPArF/qcIESyw7OiqstVehIbrEepi7AJO4WqjKrZ+kLMiIkTOWrTBw==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-20T01:50:21.148737Z","bundle_sha256":"b64ebfa5747e5af68593bc4f5fb48cf0c45321ba89efdcf5e5fa70a463678057"}}