{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:P4EC2URZPYKNGCSTZVMLHCNVGM","short_pith_number":"pith:P4EC2URZ","canonical_record":{"source":{"id":"2505.08078","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T21:24:22Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"43019cd0fbd4708fbce70128a873223afc3ec42dfc1f3215c0444a2b13060230","abstract_canon_sha256":"09285084a2e8622452506fb6eef2da4c4991f8b286b83674ed45e154af00a7f6"},"schema_version":"1.0"},"canonical_sha256":"7f082d52397e14d30a53cd58b389b533398f0bde3865980fb6c50dda304ffcc2","source":{"kind":"arxiv","id":"2505.08078","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.08078","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"arxiv_version","alias_value":"2505.08078v1","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.08078","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_12","alias_value":"P4EC2URZPYKN","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_16","alias_value":"P4EC2URZPYKNGCST","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_8","alias_value":"P4EC2URZ","created_at":"2026-07-05T11:02:02Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:P4EC2URZPYKNGCSTZVMLHCNVGM","target":"record","payload":{"canonical_record":{"source":{"id":"2505.08078","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T21:24:22Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"43019cd0fbd4708fbce70128a873223afc3ec42dfc1f3215c0444a2b13060230","abstract_canon_sha256":"09285084a2e8622452506fb6eef2da4c4991f8b286b83674ed45e154af00a7f6"},"schema_version":"1.0"},"canonical_sha256":"7f082d52397e14d30a53cd58b389b533398f0bde3865980fb6c50dda304ffcc2","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:02:02.485427Z","signature_b64":"ycVRTuJBF5V/NmTOZKkxMwpeE/Qo/9X6ugZJMpwkUUgM1AcpATBdosNnheUwSC3a+2k1JKNNJEgaLT/kTzfHAg==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"7f082d52397e14d30a53cd58b389b533398f0bde3865980fb6c50dda304ffcc2","last_reissued_at":"2026-07-05T11:02:02.484934Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:02:02.484934Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2505.08078","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:02:02Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"KE/yw9P4ttJl+b/X5F9ffQGdtAjCYQTxq9nqlLALIGQf3duD/PzX8JByZ8nZauKHG9/8PT/pDnEmElUKxVu8AA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T05:37:40.918008Z"},"content_sha256":"4e3f0c444efa543efde2d543388cb30bf05246f7254f13572a67cdcfe1fffac0","schema_version":"1.0","event_id":"sha256:4e3f0c444efa543efde2d543388cb30bf05246f7254f13572a67cdcfe1fffac0"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:P4EC2URZPYKNGCSTZVMLHCNVGM","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"What Matters for Batch Online Reinforcement Learning in Robotics?","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.RO","authors_text":"Chelsea Finn, Dorsa Sadigh, Perry Dong, Suvir Mirchandani","submitted_at":"2025-05-12T21:24:22Z","abstract_excerpt":"The ability to learn from large batches of autonomously collected data for policy improvement -- a paradigm we refer to as batch online reinforcement learning -- holds the promise of enabling truly scalable robot learning by significantly reducing the need for human effort of data collection while getting benefits from self-improvement. Yet, despite the promise of this paradigm, it remains challenging to achieve due to algorithms not being able to learn effectively from the autonomous data. For example, prior works have applied imitation learning and filtered imitation learning methods to the "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.08078","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2505.08078/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T11:02:02Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"oz8xUJdj9avEXc72IOkC4q2ba6HPoC8kwYY87Igq97N6Prs0tVMV241fNkWAvFCItQVHxP1WZVxtkVgKTOyGBg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T05:37:40.918498Z"},"content_sha256":"fa0fb9f48549b1b7cd00c3214074769596d6495fc55b937c987fe3fa9f99b32c","schema_version":"1.0","event_id":"sha256:fa0fb9f48549b1b7cd00c3214074769596d6495fc55b937c987fe3fa9f99b32c"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/bundle.json","state_url":"https://pith.science/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-07T05:37:40Z","links":{"resolver":"https://pith.science/pith/P4EC2URZPYKNGCSTZVMLHCNVGM","bundle":"https://pith.science/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/bundle.json","state":"https://pith.science/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/state.json","well_known_bundle":"https://pith.science/.well-known/pith/P4EC2URZPYKNGCSTZVMLHCNVGM/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:P4EC2URZPYKNGCSTZVMLHCNVGM","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"09285084a2e8622452506fb6eef2da4c4991f8b286b83674ed45e154af00a7f6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T21:24:22Z","title_canon_sha256":"43019cd0fbd4708fbce70128a873223afc3ec42dfc1f3215c0444a2b13060230"},"schema_version":"1.0","source":{"id":"2505.08078","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2505.08078","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"arxiv_version","alias_value":"2505.08078v1","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2505.08078","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_12","alias_value":"P4EC2URZPYKN","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_16","alias_value":"P4EC2URZPYKNGCST","created_at":"2026-07-05T11:02:02Z"},{"alias_kind":"pith_short_8","alias_value":"P4EC2URZ","created_at":"2026-07-05T11:02:02Z"}],"graph_snapshots":[{"event_id":"sha256:fa0fb9f48549b1b7cd00c3214074769596d6495fc55b937c987fe3fa9f99b32c","target":"graph","created_at":"2026-07-05T11:02:02Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2505.08078/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"The ability to learn from large batches of autonomously collected data for policy improvement -- a paradigm we refer to as batch online reinforcement learning -- holds the promise of enabling truly scalable robot learning by significantly reducing the need for human effort of data collection while getting benefits from self-improvement. Yet, despite the promise of this paradigm, it remains challenging to achieve due to algorithms not being able to learn effectively from the autonomous data. For example, prior works have applied imitation learning and filtered imitation learning methods to the ","authors_text":"Chelsea Finn, Dorsa Sadigh, Perry Dong, Suvir Mirchandani","cross_cats":["cs.AI"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T21:24:22Z","title":"What Matters for Batch Online Reinforcement Learning in Robotics?"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2505.08078","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:4e3f0c444efa543efde2d543388cb30bf05246f7254f13572a67cdcfe1fffac0","target":"record","created_at":"2026-07-05T11:02:02Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"09285084a2e8622452506fb6eef2da4c4991f8b286b83674ed45e154af00a7f6","cross_cats_sorted":["cs.AI"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.RO","submitted_at":"2025-05-12T21:24:22Z","title_canon_sha256":"43019cd0fbd4708fbce70128a873223afc3ec42dfc1f3215c0444a2b13060230"},"schema_version":"1.0","source":{"id":"2505.08078","kind":"arxiv","version":1}},"canonical_sha256":"7f082d52397e14d30a53cd58b389b533398f0bde3865980fb6c50dda304ffcc2","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"7f082d52397e14d30a53cd58b389b533398f0bde3865980fb6c50dda304ffcc2","first_computed_at":"2026-07-05T11:02:02.484934Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T11:02:02.484934Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"ycVRTuJBF5V/NmTOZKkxMwpeE/Qo/9X6ugZJMpwkUUgM1AcpATBdosNnheUwSC3a+2k1JKNNJEgaLT/kTzfHAg==","signature_status":"signed_v1","signed_at":"2026-07-05T11:02:02.485427Z","signed_message":"canonical_sha256_bytes"},"source_id":"2505.08078","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:4e3f0c444efa543efde2d543388cb30bf05246f7254f13572a67cdcfe1fffac0","sha256:fa0fb9f48549b1b7cd00c3214074769596d6495fc55b937c987fe3fa9f99b32c"],"state_sha256":"36e188c942a6fd5b877c49a16072be1608c174593335acfc7a222d4a59bc4a5a"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"GoL6X3DcsonUdrT+Qw2MDeQ7zgr/bo9/jSNZnQkfwrONLxSq1p7iZCF+l+IuYfdBkUrAxNvMRgwsv1W+hwS0AQ==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-07T05:37:40.923022Z","bundle_sha256":"26923d4691791b4fce9c9a5e42ecb44f40cbd1592ade37ac67f58970dc12df2e"}}