{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:RI454OYJIWMLBNGGT3KXDNQQVJ","short_pith_number":"pith:RI454OYJ","canonical_record":{"source":{"id":"2405.17287","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-27T15:52:27Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"7a0494ecd2eeb664f60bebe0aabc53aecb2c83be2d70b418de20a7cff31fea8c","abstract_canon_sha256":"9a4bbbe8b8ba8bf3ac3d58637989871fcaf7cc910f4b85a5dab15cd0cb98a714"},"schema_version":"1.0"},"canonical_sha256":"8a39de3b094598b0b4c69ed571b610aa5b5ad51d1d9673e38f52779839f93934","source":{"kind":"arxiv","id":"2405.17287","version":2},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2405.17287","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"arxiv_version","alias_value":"2405.17287v2","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.17287","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_12","alias_value":"RI454OYJIWML","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_16","alias_value":"RI454OYJIWMLBNGG","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_8","alias_value":"RI454OYJ","created_at":"2026-07-05T08:51:52Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:RI454OYJIWMLBNGGT3KXDNQQVJ","target":"record","payload":{"canonical_record":{"source":{"id":"2405.17287","kind":"arxiv","version":2},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-27T15:52:27Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"7a0494ecd2eeb664f60bebe0aabc53aecb2c83be2d70b418de20a7cff31fea8c","abstract_canon_sha256":"9a4bbbe8b8ba8bf3ac3d58637989871fcaf7cc910f4b85a5dab15cd0cb98a714"},"schema_version":"1.0"},"canonical_sha256":"8a39de3b094598b0b4c69ed571b610aa5b5ad51d1d9673e38f52779839f93934","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T08:51:52.753560Z","signature_b64":"0TFmDnJea9V7Zlvqi6k4ROO9PlIwA4YYjCJ/t2SEKPhtoNk/z9dl9+4Snph+l4AoJyJqRPhmjdIAY1xT+WwYCA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"8a39de3b094598b0b4c69ed571b610aa5b5ad51d1d9673e38f52779839f93934","last_reissued_at":"2026-07-05T08:51:52.753134Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T08:51:52.753134Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2405.17287","source_version":2,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T08:51:52Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"kBOzZ7hudON+QR6h1sXeRphTpoEB8V/tfhx0KMhRIGPwvBtza5p5aLxRBV6ujzhHf7xoesTPwq5R2lzyJVHIAA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T12:31:57.774551Z"},"content_sha256":"c01eedf39562c3303acb948ec84f183d3b9cb332b498d221e91827ae5ff369ac","schema_version":"1.0","event_id":"sha256:c01eedf39562c3303acb948ec84f183d3b9cb332b498d221e91827ae5ff369ac"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:RI454OYJIWMLBNGGT3KXDNQQVJ","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Opinion-Guided Reinforcement Learning","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Istvan David, Kyanna Dagenais","submitted_at":"2024-05-27T15:52:27Z","abstract_excerpt":"Human guidance is often desired in reinforcement learning to improve the performance of the learning agent. However, human insights are often mere opinions and educated guesses rather than well-formulated arguments. While opinions are subject to uncertainty, e.g., due to partial informedness or ignorance about a problem, they also emerge earlier than hard evidence can be produced. Thus, guiding reinforcement learning agents by way of opinions offers the potential for more performant learning processes, but comes with the challenge of modeling and managing opinions in a formal way. In this arti"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.17287","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2405.17287/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T08:51:52Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"b04vfuIqzW+xhZK0WeIA+bdVLWYtLai00WU+Jht0jHDfk+9qJhubfIaJc+LszOT0S3lFnHRKqix0YRDyQ5qwBA==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-08T12:31:57.775180Z"},"content_sha256":"80169ae49cebbf17cb1586ffa5cfd20af1ebc2b39ef1cabb5c31197830d5295f","schema_version":"1.0","event_id":"sha256:80169ae49cebbf17cb1586ffa5cfd20af1ebc2b39ef1cabb5c31197830d5295f"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/bundle.json","state_url":"https://pith.science/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-08T12:31:57Z","links":{"resolver":"https://pith.science/pith/RI454OYJIWMLBNGGT3KXDNQQVJ","bundle":"https://pith.science/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/bundle.json","state":"https://pith.science/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/state.json","well_known_bundle":"https://pith.science/.well-known/pith/RI454OYJIWMLBNGGT3KXDNQQVJ/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:RI454OYJIWMLBNGGT3KXDNQQVJ","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"9a4bbbe8b8ba8bf3ac3d58637989871fcaf7cc910f4b85a5dab15cd0cb98a714","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-27T15:52:27Z","title_canon_sha256":"7a0494ecd2eeb664f60bebe0aabc53aecb2c83be2d70b418de20a7cff31fea8c"},"schema_version":"1.0","source":{"id":"2405.17287","kind":"arxiv","version":2}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2405.17287","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"arxiv_version","alias_value":"2405.17287v2","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2405.17287","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_12","alias_value":"RI454OYJIWML","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_16","alias_value":"RI454OYJIWMLBNGG","created_at":"2026-07-05T08:51:52Z"},{"alias_kind":"pith_short_8","alias_value":"RI454OYJ","created_at":"2026-07-05T08:51:52Z"}],"graph_snapshots":[{"event_id":"sha256:80169ae49cebbf17cb1586ffa5cfd20af1ebc2b39ef1cabb5c31197830d5295f","target":"graph","created_at":"2026-07-05T08:51:52Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2405.17287/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Human guidance is often desired in reinforcement learning to improve the performance of the learning agent. However, human insights are often mere opinions and educated guesses rather than well-formulated arguments. While opinions are subject to uncertainty, e.g., due to partial informedness or ignorance about a problem, they also emerge earlier than hard evidence can be produced. Thus, guiding reinforcement learning agents by way of opinions offers the potential for more performant learning processes, but comes with the challenge of modeling and managing opinions in a formal way. In this arti","authors_text":"Istvan David, Kyanna Dagenais","cross_cats":["cs.AI"],"headline":"","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-27T15:52:27Z","title":"Opinion-Guided Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2405.17287","kind":"arxiv","version":2},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:c01eedf39562c3303acb948ec84f183d3b9cb332b498d221e91827ae5ff369ac","target":"record","created_at":"2026-07-05T08:51:52Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"9a4bbbe8b8ba8bf3ac3d58637989871fcaf7cc910f4b85a5dab15cd0cb98a714","cross_cats_sorted":["cs.AI"],"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.LG","submitted_at":"2024-05-27T15:52:27Z","title_canon_sha256":"7a0494ecd2eeb664f60bebe0aabc53aecb2c83be2d70b418de20a7cff31fea8c"},"schema_version":"1.0","source":{"id":"2405.17287","kind":"arxiv","version":2}},"canonical_sha256":"8a39de3b094598b0b4c69ed571b610aa5b5ad51d1d9673e38f52779839f93934","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"8a39de3b094598b0b4c69ed571b610aa5b5ad51d1d9673e38f52779839f93934","first_computed_at":"2026-07-05T08:51:52.753134Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T08:51:52.753134Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"0TFmDnJea9V7Zlvqi6k4ROO9PlIwA4YYjCJ/t2SEKPhtoNk/z9dl9+4Snph+l4AoJyJqRPhmjdIAY1xT+WwYCA==","signature_status":"signed_v1","signed_at":"2026-07-05T08:51:52.753560Z","signed_message":"canonical_sha256_bytes"},"source_id":"2405.17287","source_kind":"arxiv","source_version":2}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:c01eedf39562c3303acb948ec84f183d3b9cb332b498d221e91827ae5ff369ac","sha256:80169ae49cebbf17cb1586ffa5cfd20af1ebc2b39ef1cabb5c31197830d5295f"],"state_sha256":"993ce3a766eca0bd3dd854a0490c79d11d6e814282449a648fbd9da96feea032"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"auKDee07ICGlA6ouaAM06YcmYmqEbrsamflt/kq3KMSoZkFJo7uCM5tbT7PhyOn1oAMXy2melwmLx+xOiLj3Aw==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-08T12:31:57.780593Z","bundle_sha256":"ced2a61beae88f47cb6e58330ccea27a7057b9b4ba80012066ced20345cd63a1"}}