{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2025:5L46BCDEUVZ4FKLYY45RLQ3KPT","short_pith_number":"pith:5L46BCDE","canonical_record":{"source":{"id":"2501.15495","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-26T11:53:18Z","cross_cats_sorted":["cs.LG","cs.MA"],"title_canon_sha256":"26ad04147c71cfff20856a3b7313361e98c0b45c4ad45da8751bfc21e4d433a2","abstract_canon_sha256":"cc166bc0b65f635af219da00d6490855904cc47ecef76372745e7a36e1e2787c"},"schema_version":"1.0"},"canonical_sha256":"eaf9e08864a573c2a978c73b15c36a7cc1656ab54693991d1ab74e161c8e37c9","source":{"kind":"arxiv","id":"2501.15495","version":1},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.15495","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"arxiv_version","alias_value":"2501.15495v1","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.15495","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_12","alias_value":"5L46BCDEUVZ4","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_16","alias_value":"5L46BCDEUVZ4FKLY","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_8","alias_value":"5L46BCDE","created_at":"2026-07-05T10:05:30Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2025:5L46BCDEUVZ4FKLYY45RLQ3KPT","target":"record","payload":{"canonical_record":{"source":{"id":"2501.15495","kind":"arxiv","version":1},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-26T11:53:18Z","cross_cats_sorted":["cs.LG","cs.MA"],"title_canon_sha256":"26ad04147c71cfff20856a3b7313361e98c0b45c4ad45da8751bfc21e4d433a2","abstract_canon_sha256":"cc166bc0b65f635af219da00d6490855904cc47ecef76372745e7a36e1e2787c"},"schema_version":"1.0"},"canonical_sha256":"eaf9e08864a573c2a978c73b15c36a7cc1656ab54693991d1ab74e161c8e37c9","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:05:30.174841Z","signature_b64":"U6yTuqJhZo3PtTLiFx9Oit96/Ujf8fkwZTUKBYaS6xaru0B4CNRuMoCeAcfr5XjaDE1zANubVT7a2JX8sXSPDA==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"eaf9e08864a573c2a978c73b15c36a7cc1656ab54693991d1ab74e161c8e37c9","last_reissued_at":"2026-07-05T10:05:30.174357Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:05:30.174357Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2501.15495","source_version":1,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:05:30Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"9raJJhWRUpHfX7vS4/HJty5z2WUJ/VIUSaSfHICcXrC/kGANunPXuiEXu6GUOTSDGlvnJ1EuQJy0WPDmZTpQAg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-17T03:04:59.759041Z"},"content_sha256":"5bb6b97e6552c004b367fa96c12ead45de6151007ffc9ca42ab564d2aa50c187","schema_version":"1.0","event_id":"sha256:5bb6b97e6552c004b367fa96c12ead45de6151007ffc9ca42ab564d2aa50c187"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2025:5L46BCDEUVZ4FKLYY45RLQ3KPT","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.LG","cs.MA"],"primary_cat":"cs.AI","authors_text":"Alberto Castagna","submitted_at":"2025-01-26T11:53:18Z","abstract_excerpt":"Reinforcement Learning (RL) enables an intelligent agent to optimise its performance in a task by continuously taking action from an observed state and receiving a feedback from the environment in form of rewards. RL typically uses tables or linear approximators to map state-action tuples that maximises the reward. Combining RL with deep neural networks (DRL) significantly increases its scalability and enables it to address more complex problems than before. However, DRL also inherits downsides from both RL and deep learning. Despite DRL improves generalisation across similar state-action pair"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.15495","kind":"arxiv","version":1},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2501.15495/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:05:30Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"L86/7aMDGmLfH3Qz9A/Lh7ujHlHN4eLRlh3B4stfAQKuqsPzHGJ34CPnznjMyVifrG80ZD3ndFuOxnZDLom9Cw==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-17T03:04:59.759955Z"},"content_sha256":"a6d5254cb805e1088ace05aaf2edbbd61395854fadd0c9ee293a8e55d2e59eb9","schema_version":"1.0","event_id":"sha256:a6d5254cb805e1088ace05aaf2edbbd61395854fadd0c9ee293a8e55d2e59eb9"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/bundle.json","state_url":"https://pith.science/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-17T03:04:59Z","links":{"resolver":"https://pith.science/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT","bundle":"https://pith.science/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/bundle.json","state":"https://pith.science/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/state.json","well_known_bundle":"https://pith.science/.well-known/pith/5L46BCDEUVZ4FKLYY45RLQ3KPT/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2025:5L46BCDEUVZ4FKLYY45RLQ3KPT","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"cc166bc0b65f635af219da00d6490855904cc47ecef76372745e7a36e1e2787c","cross_cats_sorted":["cs.LG","cs.MA"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-26T11:53:18Z","title_canon_sha256":"26ad04147c71cfff20856a3b7313361e98c0b45c4ad45da8751bfc21e4d433a2"},"schema_version":"1.0","source":{"id":"2501.15495","kind":"arxiv","version":1}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2501.15495","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"arxiv_version","alias_value":"2501.15495v1","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2501.15495","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_12","alias_value":"5L46BCDEUVZ4","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_16","alias_value":"5L46BCDEUVZ4FKLY","created_at":"2026-07-05T10:05:30Z"},{"alias_kind":"pith_short_8","alias_value":"5L46BCDE","created_at":"2026-07-05T10:05:30Z"}],"graph_snapshots":[{"event_id":"sha256:a6d5254cb805e1088ace05aaf2edbbd61395854fadd0c9ee293a8e55d2e59eb9","target":"graph","created_at":"2026-07-05T10:05:30Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2501.15495/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Reinforcement Learning (RL) enables an intelligent agent to optimise its performance in a task by continuously taking action from an observed state and receiving a feedback from the environment in form of rewards. RL typically uses tables or linear approximators to map state-action tuples that maximises the reward. Combining RL with deep neural networks (DRL) significantly increases its scalability and enables it to address more complex problems than before. However, DRL also inherits downsides from both RL and deep learning. Despite DRL improves generalisation across similar state-action pair","authors_text":"Alberto Castagna","cross_cats":["cs.LG","cs.MA"],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-26T11:53:18Z","title":"Expert-Free Online Transfer Learning in Multi-Agent Reinforcement Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2501.15495","kind":"arxiv","version":1},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:5bb6b97e6552c004b367fa96c12ead45de6151007ffc9ca42ab564d2aa50c187","target":"record","created_at":"2026-07-05T10:05:30Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"cc166bc0b65f635af219da00d6490855904cc47ecef76372745e7a36e1e2787c","cross_cats_sorted":["cs.LG","cs.MA"],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.AI","submitted_at":"2025-01-26T11:53:18Z","title_canon_sha256":"26ad04147c71cfff20856a3b7313361e98c0b45c4ad45da8751bfc21e4d433a2"},"schema_version":"1.0","source":{"id":"2501.15495","kind":"arxiv","version":1}},"canonical_sha256":"eaf9e08864a573c2a978c73b15c36a7cc1656ab54693991d1ab74e161c8e37c9","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"eaf9e08864a573c2a978c73b15c36a7cc1656ab54693991d1ab74e161c8e37c9","first_computed_at":"2026-07-05T10:05:30.174357Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:05:30.174357Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"U6yTuqJhZo3PtTLiFx9Oit96/Ujf8fkwZTUKBYaS6xaru0B4CNRuMoCeAcfr5XjaDE1zANubVT7a2JX8sXSPDA==","signature_status":"signed_v1","signed_at":"2026-07-05T10:05:30.174841Z","signed_message":"canonical_sha256_bytes"},"source_id":"2501.15495","source_kind":"arxiv","source_version":1}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:5bb6b97e6552c004b367fa96c12ead45de6151007ffc9ca42ab564d2aa50c187","sha256:a6d5254cb805e1088ace05aaf2edbbd61395854fadd0c9ee293a8e55d2e59eb9"],"state_sha256":"a001ea90d4dabcb9e94d506298e33e2a95be04c4b2bc2ce2c35f95bd362e4358"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"Ee10O4AgPOTfLzJesaz3i09qICRk5GSMdlUFpHlkxHHy6eZvrqTq4BZxGEXF3lPuh7UqidHwA2h1XonsEzglDg==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-17T03:04:59.769591Z","bundle_sha256":"a30614411a219209f91eb9da4ec50b4be1d993d373450c5ae9db1dc63af53ce6"}}