{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:HMTFFKXLUUJ2I7RE6WRD67XHRL","short_pith_number":"pith:HMTFFKXL","schema_version":"1.0","canonical_sha256":"3b2652aaeba513a47e24f5a23f7ee78acad0b4a4216d136703bc51cd4effb093","source":{"kind":"arxiv","id":"2504.17243","version":2},"attestation_state":"computed","paper":{"title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Jie Fu, Martin Jaggi, Simin Fan, Xinyu Zhou","submitted_at":"2025-04-24T04:41:35Z","abstract_excerpt":"Grokking is proposed and widely studied as an intricate phenomenon in which generalization is achieved after a long-lasting period of overfitting. In this work, we propose NeuralGrok, a novel gradient-based approach that learns an optimal gradient transformation to accelerate the generalization of transformers in arithmetic tasks. Specifically, NeuralGrok trains an auxiliary module (e.g., an MLP block) in conjunction with the base model. This module dynamically modulates the influence of individual gradient components based on their contribution to generalization, guided by a bilevel optimizat"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2504.17243","kind":"arxiv","version":2},"metadata":{"license":"http://creativecommons.org/licenses/by-sa/4.0/","primary_cat":"cs.LG","submitted_at":"2025-04-24T04:41:35Z","cross_cats_sorted":["cs.AI"],"title_canon_sha256":"f97e0629ba234aa433e3d102b153c4e2dd08446add372339d2065950357915d3","abstract_canon_sha256":"713971594623cc13bf9e22a94a847324e8bdad3142edfa33354235e280a3384b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T10:53:55.466463Z","signature_b64":"gZfLoFlHbq1fn3fkzlSNo8QdAb1ZV7OIBvRONRRasWPvvAtFNbWePIg5YA8RboM3Fi1SpuxMvyssP5Wkxjz4Cw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3b2652aaeba513a47e24f5a23f7ee78acad0b4a4216d136703bc51cd4effb093","last_reissued_at":"2026-07-05T10:53:55.465947Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T10:53:55.465947Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"NeuralGrok: Accelerate Grokking by Neural Gradient Transformation","license":"http://creativecommons.org/licenses/by-sa/4.0/","headline":"","cross_cats":["cs.AI"],"primary_cat":"cs.LG","authors_text":"Jie Fu, Martin Jaggi, Simin Fan, Xinyu Zhou","submitted_at":"2025-04-24T04:41:35Z","abstract_excerpt":"Grokking is proposed and widely studied as an intricate phenomenon in which generalization is achieved after a long-lasting period of overfitting. In this work, we propose NeuralGrok, a novel gradient-based approach that learns an optimal gradient transformation to accelerate the generalization of transformers in arithmetic tasks. Specifically, NeuralGrok trains an auxiliary module (e.g., an MLP block) in conjunction with the base model. This module dynamically modulates the influence of individual gradient components based on their contribution to generalization, guided by a bilevel optimizat"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2504.17243","kind":"arxiv","version":2},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2504.17243/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2504.17243","created_at":"2026-07-05T10:53:55.466011+00:00"},{"alias_kind":"arxiv_version","alias_value":"2504.17243v2","created_at":"2026-07-05T10:53:55.466011+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2504.17243","created_at":"2026-07-05T10:53:55.466011+00:00"},{"alias_kind":"pith_short_12","alias_value":"HMTFFKXLUUJ2","created_at":"2026-07-05T10:53:55.466011+00:00"},{"alias_kind":"pith_short_16","alias_value":"HMTFFKXLUUJ2I7RE","created_at":"2026-07-05T10:53:55.466011+00:00"},{"alias_kind":"pith_short_8","alias_value":"HMTFFKXL","created_at":"2026-07-05T10:53:55.466011+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":1,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.32000","citing_title":"Radial Suppression Accelerates Algorithmic Generalization: A Geometric Analysis of Delayed Generalization","ref_index":33,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL","json":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL.json","graph_json":"https://pith.science/api/pith-number/HMTFFKXLUUJ2I7RE6WRD67XHRL/graph.json","events_json":"https://pith.science/api/pith-number/HMTFFKXLUUJ2I7RE6WRD67XHRL/events.json","paper":"https://pith.science/paper/HMTFFKXL"},"agent_actions":{"view_html":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL","download_json":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL.json","view_paper":"https://pith.science/paper/HMTFFKXL","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2504.17243&json=true","fetch_graph":"https://pith.science/api/pith-number/HMTFFKXLUUJ2I7RE6WRD67XHRL/graph.json","fetch_events":"https://pith.science/api/pith-number/HMTFFKXLUUJ2I7RE6WRD67XHRL/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL/action/storage_attestation","attest_author":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL/action/author_attestation","sign_citation":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL/action/citation_signature","submit_replication":"https://pith.science/pith/HMTFFKXLUUJ2I7RE6WRD67XHRL/action/replication_record"}},"created_at":"2026-07-05T10:53:55.466011+00:00","updated_at":"2026-07-05T10:53:55.466011+00:00"}