{"bundle_type":"pith_open_graph_bundle","bundle_version":"1.0","pith_number":"pith:2024:EYTSET24SA7E7F4EXAX5VFHZSG","short_pith_number":"pith:EYTSET24","canonical_record":{"source":{"id":"2407.04811","kind":"arxiv","version":6},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T18:49:07Z","cross_cats_sorted":[],"title_canon_sha256":"434926274aeb1a57346d2b448a9dc5a7d9d364bd7d08a5342bb6e7bf40d9a57d","abstract_canon_sha256":"a092048e00099d3176b38dab36189ab3ff221c909b9eb5fed1c7503627b2b85d"},"schema_version":"1.0"},"canonical_sha256":"2627224f5c903e4f9784b82fda94f991b45ccf8f48c2ed8c39244db623e474f6","source":{"kind":"arxiv","id":"2407.04811","version":6},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2407.04811","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"arxiv_version","alias_value":"2407.04811v6","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.04811","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_12","alias_value":"EYTSET24SA7E","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_16","alias_value":"EYTSET24SA7E7F4E","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_8","alias_value":"EYTSET24","created_at":"2026-07-05T10:52:12Z"}],"events":[{"event_type":"record_created","subject_pith_number":"pith:2024:EYTSET24SA7E7F4EXAX5VFHZSG","target":"record","payload":{"canonical_record":{"source":{"id":"2407.04811","kind":"arxiv","version":6},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T18:49:07Z","cross_cats_sorted":[],"title_canon_sha256":"434926274aeb1a57346d2b448a9dc5a7d9d364bd7d08a5342bb6e7bf40d9a57d","abstract_canon_sha256":"a092048e00099d3176b38dab36189ab3ff221c909b9eb5fed1c7503627b2b85d"},"schema_version":"1.0"},"canonical_sha256":"2627224f5c903e4f9784b82fda94f991b45ccf8f48c2ed8c39244db623e474f6","receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:52:12.670712Z","signature_b64":"mKuUIzyh5NZYVg8xGruPSfMHVLQE2HVD6IT7Y09XbCIULUkMLmXYP5OddPXVlGzQ+UwyNsKAYUOr2fjK2prODQ==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"2627224f5c903e4f9784b82fda94f991b45ccf8f48c2ed8c39244db623e474f6","last_reissued_at":"2026-07-05T10:52:12.670112Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:52:12.670112Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"source_kind":"arxiv","source_id":"2407.04811","source_version":6,"attestation_state":"computed"},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:52:12Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"1N6QmSwzb0Ph12YVPM6Ua96A7cxfxahTij9WYoo2IhBJgh5BDlK6Xt1kmJbPIg/brP/c9av2h9seg7d6XINCDg==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T20:59:18.404447Z"},"content_sha256":"34122253eeb00f91a97aad3fbde68dddfe7faff5cbbffadd19c3eb73152b193b","schema_version":"1.0","event_id":"sha256:34122253eeb00f91a97aad3fbde68dddfe7faff5cbbffadd19c3eb73152b193b"},{"event_type":"graph_snapshot","subject_pith_number":"pith:2024:EYTSET24SA7E7F4EXAX5VFHZSG","target":"graph","payload":{"graph_snapshot":{"paper":{"title":"Simplifying Deep Temporal Difference Learning","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":[],"primary_cat":"cs.LG","authors_text":"Bartomeu Pou, Benjamin Ellis, Ivan Masmitja, Jakob Nicolaus Foerster, Mario Martin, Matteo Gallici, Mattie Fellows","submitted_at":"2024-07-05T18:49:07Z","abstract_excerpt":"Q-learning played a foundational role in the field reinforcement learning (RL). However, TD algorithms with off-policy data, such as Q-learning, or nonlinear function approximation like deep neural networks require several additional tricks to stabilise training, primarily a large replay buffer and target networks. Unfortunately, the delayed updating of frozen network parameters in the target network harms the sample efficiency and, similarly, the large replay buffer introduces memory and implementation overheads. In this paper, we investigate whether it is possible to accelerate and simplify "},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.04811","kind":"arxiv","version":6},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2407.04811/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"verdict_id":null},"signer":{"signer_id":"pith.science","signer_type":"pith_registry","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"created_at":"2026-07-05T10:52:12Z","supersedes":[],"prev_event":null,"signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"thKoQPgWbq7ykr5Ves5DxX5a0peUaY+TAhr/QisVD8c7lDdQ28vgzYKqhMbro7XUwfo2K3xyuH7oXnY0oAy2AQ==","signed_message":"open_graph_event_sha256_bytes","signed_at":"2026-08-07T20:59:18.404977Z"},"content_sha256":"8ef43c052a8878c3c02ac36f9a29c7e3adfb94b91611032232c077d1fdf911f1","schema_version":"1.0","event_id":"sha256:8ef43c052a8878c3c02ac36f9a29c7e3adfb94b91611032232c077d1fdf911f1"}],"timestamp_proofs":[],"mirror_hints":[{"mirror_type":"https","name":"Pith Resolver","base_url":"https://pith.science","bundle_url":"https://pith.science/pith/EYTSET24SA7E7F4EXAX5VFHZSG/bundle.json","state_url":"https://pith.science/pith/EYTSET24SA7E7F4EXAX5VFHZSG/state.json","well_known_bundle_url":"https://pith.science/.well-known/pith/EYTSET24SA7E7F4EXAX5VFHZSG/bundle.json","status":"primary"}],"public_keys":[{"key_id":"pith-v1-2026-05","algorithm":"ed25519","format":"raw","public_key_b64":"stVStoiQhXFxp4s2pdzPNoqVNBMojDU/fJ2db5S3CbM=","public_key_hex":"b2d552b68890857171a78b36a5dccf368a953413288c353f7c9d9d6f94b709b3","fingerprint_sha256_b32_first128bits":"RVFV5Z2OI2J3ZUO7ERDEBCYNKS","fingerprint_sha256_hex":"8d4b5ee74e4693bcd1df2446408b0d54","rotates_at":null,"url":"https://pith.science/pith-signing-key.json","notes":"Pith uses this Ed25519 key to sign canonical record SHA-256 digests. Verify with: ed25519_verify(public_key, message=canonical_sha256_bytes, signature=base64decode(signature_b64))."}],"merge_version":"pith-open-graph-merge-v1","built_at":"2026-08-07T20:59:18Z","links":{"resolver":"https://pith.science/pith/EYTSET24SA7E7F4EXAX5VFHZSG","bundle":"https://pith.science/pith/EYTSET24SA7E7F4EXAX5VFHZSG/bundle.json","state":"https://pith.science/pith/EYTSET24SA7E7F4EXAX5VFHZSG/state.json","well_known_bundle":"https://pith.science/.well-known/pith/EYTSET24SA7E7F4EXAX5VFHZSG/bundle.json"},"state":{"state_type":"pith_open_graph_state","state_version":"1.0","pith_number":"pith:2024:EYTSET24SA7E7F4EXAX5VFHZSG","merge_version":"pith-open-graph-merge-v1","event_count":2,"valid_event_count":2,"invalid_event_count":0,"equivocation_count":0,"current":{"canonical_record":{"metadata":{"abstract_canon_sha256":"a092048e00099d3176b38dab36189ab3ff221c909b9eb5fed1c7503627b2b85d","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T18:49:07Z","title_canon_sha256":"434926274aeb1a57346d2b448a9dc5a7d9d364bd7d08a5342bb6e7bf40d9a57d"},"schema_version":"1.0","source":{"id":"2407.04811","kind":"arxiv","version":6}},"source_aliases":[{"alias_kind":"arxiv","alias_value":"2407.04811","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"arxiv_version","alias_value":"2407.04811v6","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2407.04811","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_12","alias_value":"EYTSET24SA7E","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_16","alias_value":"EYTSET24SA7E7F4E","created_at":"2026-07-05T10:52:12Z"},{"alias_kind":"pith_short_8","alias_value":"EYTSET24","created_at":"2026-07-05T10:52:12Z"}],"graph_snapshots":[{"event_id":"sha256:8ef43c052a8878c3c02ac36f9a29c7e3adfb94b91611032232c077d1fdf911f1","target":"graph","created_at":"2026-07-05T10:52:12Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"graph_snapshot":{"author_claims":{"count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","strong_count":0},"builder_version":"pith-number-builder-2026-05-17-v1","claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"integrity":{"available":true,"clean":true,"detectors_run":[],"endpoint":"/pith/2407.04811/integrity.json","findings":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938","summary":{"advisory":0,"by_detector":{},"critical":0,"informational":0}},"paper":{"abstract_excerpt":"Q-learning played a foundational role in the field reinforcement learning (RL). However, TD algorithms with off-policy data, such as Q-learning, or nonlinear function approximation like deep neural networks require several additional tricks to stabilise training, primarily a large replay buffer and target networks. Unfortunately, the delayed updating of frozen network parameters in the target network harms the sample efficiency and, similarly, the large replay buffer introduces memory and implementation overheads. In this paper, we investigate whether it is possible to accelerate and simplify ","authors_text":"Bartomeu Pou, Benjamin Ellis, Ivan Masmitja, Jakob Nicolaus Foerster, Mario Martin, Matteo Gallici, Mattie Fellows","cross_cats":[],"headline":"","license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T18:49:07Z","title":"Simplifying Deep Temporal Difference Learning"},"references":{"count":0,"internal_anchors":0,"resolved_work":0,"sample":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2407.04811","kind":"arxiv","version":6},"verdict":{"created_at":null,"id":null,"model_set":{},"one_line_summary":"","pipeline_version":null,"pith_extraction_headline":"","strongest_claim":"","weakest_assumption":""}},"verdict_id":null}}],"author_attestations":[],"timestamp_anchors":[],"storage_attestations":[],"citation_signatures":[],"replication_records":[],"corrections":[],"mirror_hints":[],"record_created":{"event_id":"sha256:34122253eeb00f91a97aad3fbde68dddfe7faff5cbbffadd19c3eb73152b193b","target":"record","created_at":"2026-07-05T10:52:12Z","signer":{"key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signer_id":"pith.science","signer_type":"pith_registry"},"payload":{"attestation_state":"computed","canonical_record":{"metadata":{"abstract_canon_sha256":"a092048e00099d3176b38dab36189ab3ff221c909b9eb5fed1c7503627b2b85d","cross_cats_sorted":[],"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.LG","submitted_at":"2024-07-05T18:49:07Z","title_canon_sha256":"434926274aeb1a57346d2b448a9dc5a7d9d364bd7d08a5342bb6e7bf40d9a57d"},"schema_version":"1.0","source":{"id":"2407.04811","kind":"arxiv","version":6}},"canonical_sha256":"2627224f5c903e4f9784b82fda94f991b45ccf8f48c2ed8c39244db623e474f6","receipt":{"algorithm":"ed25519","builder_version":"pith-number-builder-2026-05-17-v1","canonical_sha256":"2627224f5c903e4f9784b82fda94f991b45ccf8f48c2ed8c39244db623e474f6","first_computed_at":"2026-07-05T10:52:12.670112Z","key_id":"pith-v1-2026-05","kind":"pith_receipt","last_reissued_at":"2026-07-05T10:52:12.670112Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","receipt_version":"0.3","signature_b64":"mKuUIzyh5NZYVg8xGruPSfMHVLQE2HVD6IT7Y09XbCIULUkMLmXYP5OddPXVlGzQ+UwyNsKAYUOr2fjK2prODQ==","signature_status":"signed_v1","signed_at":"2026-07-05T10:52:12.670712Z","signed_message":"canonical_sha256_bytes"},"source_id":"2407.04811","source_kind":"arxiv","source_version":6}}},"equivocations":[],"invalid_events":[],"applied_event_ids":["sha256:34122253eeb00f91a97aad3fbde68dddfe7faff5cbbffadd19c3eb73152b193b","sha256:8ef43c052a8878c3c02ac36f9a29c7e3adfb94b91611032232c077d1fdf911f1"],"state_sha256":"26ce78941942533bd0763e762d00e870c6f91b6677e9cf68a7010c6693ff809c"},"bundle_signature":{"signature_status":"signed_v1","algorithm":"ed25519","key_id":"pith-v1-2026-05","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54","signature_b64":"egf2sLYz8SuTt9spam3XOyl2ZAwBEnCQm4ElRie62SUijZjLaCiUzWnVQoAoIRefXc0rKAaEmlEhvJ1vY2cxAA==","signed_message":"bundle_sha256_bytes","signed_at":"2026-08-07T20:59:18.410360Z","bundle_sha256":"5d53c6c947bd79fed8f8378d3c300de5e1184c51cdf9227a84fba5fac93c7a46"}}