{"as_of":"2026-08-12T08:32:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:caa03230f8857df9c502b0d5e62d0fc0488cb059926112690ab3cf508527a687","coverage":[{"denominator":53,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":53,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T04:32:51.736857Z","state":"measured"},{"denominator":54,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":54,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T22:10:49.683444Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18790","snapshot_observed_at":"2026-07-11T22:10:49.683444Z","title":"Torque-aware momentum.arXiv preprint arXiv:2412.18790, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.04033","last_updated":"2026-07-04T21:27:05Z","snapshot_observed_at":"2026-08-07T05:07:10.107694Z","submitted_at":"2026-07-04T21:27:05Z","title":"OmniOpt: Taxonomy, Geometry, and Benchmarking of Modern Optimizers","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-11T22:10:49.683444Z"},"links":{"cited_paper":"/paper/2412.18790","citing_paper":"/paper/2607.04033"},"observation_digest":"sha256:70a34f84d77163476e78c5d07c9076030dd3b2cbdd38626b19753207197f56d1","observation_id":"14cc53ef-864e-47a6-8a1b-44b2c03b4521","resolution":{"observed_at":"2026-07-11T22:10:49.683444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.18790/citation-record","integrity":"/paper/2412.18790/integrity","json":"/paper/2412.18790/citation-record.json","paper":"/paper/2412.18790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.486032Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.486032Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:06a0f90442f667d524fe7f00fd0358adbab3dfa50b28e739183721c3d174b0ef","observation_id":"3bd0bc49-8fe0-4b73-9495-6ab0b52aa7b8","resolution":{"observed_at":"2026-08-11T04:32:51.486032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.620329Z","title":"Momentum improves normalized sgd","venue":null,"work_id":"216e34e5-b6f0-4e63-afe4-fda39aa2f742","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.492514Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:862bf1c95e32c9779ffdd487ba67119cefa4d67caa898d4c18e6b764c0180486","observation_id":"a4520010-6617-498b-9f28-bf9ba798d09b","resolution":{"observed_at":"2026-08-11T04:32:52.625025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.605271Z","title":"Momentum improves normalized SGD","venue":null,"work_id":"ce820f68-bffb-4f84-84d2-f609a4f40215","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.497577Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:b0c934737c9e8e36d9e1d199830fe699c697180d1d717798af2b8271390828d3","observation_id":"d2efd5a3-3d48-4a66-b580-614ad712427a","resolution":{"observed_at":"2026-08-11T04:32:52.609996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.590493Z","title":"ImageNet: A large-scale hierarchical image database","venue":null,"work_id":"2e50150a-481a-447d-8a5f-9651900ac5dd","year":2009},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.502598Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:ef2f1d074f8ea63938bc6117de1d2ee99361eef2d1e820ba100506898f1e4a48","observation_id":"cb993925-18f3-4baa-b858-98a40bb90abc","resolution":{"observed_at":"2026-08-11T04:32:52.595197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.575045Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"83ed447f-bcfd-48fc-8113-9cd3a50c413b","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.507620Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:ac5ff78997c7a580f4883f0f25cdb2ef64170e22ea56bd5807eef745cf54e767","observation_id":"d79f269c-64aa-4e8a-9b84-8e1006e42ca8","resolution":{"observed_at":"2026-08-11T04:32:52.580488Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.06325","last_updated":"2022-05-05T17:16:00Z","snapshot_observed_at":"2026-08-12T06:39:05.734750Z","submitted_at":"2021-08-13T17:33:47Z","title":"Continual Backprop: Stochastic Gradient Descent with Persistent Randomness","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.06325","snapshot_observed_at":"2026-08-11T04:32:51.512603Z","title":"Sutton, , and A","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.512603Z"},"links":{"cited_paper":"/paper/2108.06325","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:e0605562ea0030b0657417f71b2c4fec799277e9dc60daefa9dacbec13267e99","observation_id":"e8ac5cf3-46be-47d9-a53e-5633a6ef8f9b","resolution":{"observed_at":"2026-08-11T04:32:51.512603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.517646Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.517646Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:7b50c7e306a8712fc1a48c2374fb6e9e17204bec35093df3aa312bd1a643a8da","observation_id":"58c2c43d-472b-4872-bef3-5a9e1b862f29","resolution":{"observed_at":"2026-08-11T04:32:51.517646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00781","last_updated":"2024-04-30T22:52:33Z","snapshot_observed_at":"2026-08-12T06:39:11.721355Z","submitted_at":"2024-03-31T19:57:38Z","title":"Addressing Loss of Plasticity and Catastrophic Forgetting in Continual Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00781","snapshot_observed_at":"2026-08-11T04:32:51.522957Z","title":"Addressing loss of plasticity and catastrophic forgetting in continual learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.522957Z"},"links":{"cited_paper":"/paper/2404.00781","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:17dfc0f2d1427770ac40af7468741a863278522bf051a2f7e410746083dbd6e6","observation_id":"b9d53c83-3f6e-401c-ac6d-3736829a5766","resolution":{"observed_at":"2026-08-11T04:32:51.522957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.527848Z","title":"Sharpness-aware minimization for efficiently improving generalization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.527848Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d6c3a49bd964566843ad49e9281141c1b749b5791761adf2f1a30fac771caaf8","observation_id":"ca54014a-0e33-4824-8fcd-3f3b7476dd45","resolution":{"observed_at":"2026-08-11T04:32:51.527848Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.532474Z","title":"Linear mode connectivity and the lottery ticket hypothesis","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.532474Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:3c8869b1639849e039cc80620c33bfb599c4ba20728c0f2fd8a360391490b3a1","observation_id":"446ea0e8-2aea-419b-b676-d2323e95c686","resolution":{"observed_at":"2026-08-11T04:32:51.532474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.531640Z","title":"Identification of mass, damping, and stiffness matrices of mechanical systems","venue":null,"work_id":"cd4ad09e-32af-4d69-9b92-f236b1aaf051","year":1986},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.537208Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:fb22d387f0866aaf771c31e8ce8d260e735cacce9e22109425d781d77ddba9d2","observation_id":"fc535de2-a6cb-42d5-abdf-6702b80eb2d8","resolution":{"observed_at":"2026-08-11T04:32:52.536666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09000","last_updated":"2023-06-15T09:54:21Z","snapshot_observed_at":"2026-07-06T15:42:52.549767Z","submitted_at":"2023-06-15T09:54:21Z","title":"When and Why Momentum Accelerates SGD:An Empirical Study","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09000","snapshot_observed_at":"2026-08-11T04:32:51.541865Z","title":"When and why momentum accelerates sgd: An empirical study","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.541865Z"},"links":{"cited_paper":"/paper/2306.09000","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:33b1824c6da68e6fb07c82bb46c99484d00d05771706092df613656b898d2a5c","observation_id":"f44ef772-cece-4d5a-82b2-5f58cce224e4","resolution":{"observed_at":"2026-08-11T04:32:51.541865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04369","last_updated":"2021-10-08T20:25:48Z","snapshot_observed_at":"2026-08-12T06:39:05.154087Z","submitted_at":"2021-10-08T20:25:48Z","title":"A Loss Curvature Perspective on Training Instability in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04369","snapshot_observed_at":"2026-08-11T04:32:51.546755Z","title":"A loss curvature perspective on training instability in deep learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.546755Z"},"links":{"cited_paper":"/paper/2110.04369","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:418a2b10abbc389f28e4eafd0fb93c46317460cd90b1c4ecbb416ff02c8a0bd7","observation_id":"4ac4761b-0aab-4904-abf2-3b62158766e0","resolution":{"observed_at":"2026-08-11T04:32:51.546755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.551743Z","title":"The movielens datasets: History and context","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.551743Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:deaa8d1c14a7c45f53df0ddfb16d8267b443a47a4e576350c2c87f18bc7d3e74","observation_id":"f11afb00-e613-4b81-9a07-e1f776606024","resolution":{"observed_at":"2026-08-11T04:32:51.551743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.556315Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.556315Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:be5eb07a9c811d5c0c4315ab8aa98c61f85f277f18fda62a758ef37e12c11f22","observation_id":"20e81eae-3d99-46b9-8830-1be4abc9c601","resolution":{"observed_at":"2026-08-11T04:32:51.556315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04861","last_updated":"2017-04-17T03:57:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-04-17T03:57:34Z","title":"MobileNets: Efficient Convolutional Neural Networks for Mobile Vision Applications","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04861","snapshot_observed_at":"2026-08-11T04:32:51.560902Z","title":"Mobilenets: Efficient convolutional neural networks for mobile vision applications","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.560902Z"},"links":{"cited_paper":"/paper/1704.04861","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c2ee8e11ad1b308957f3134f885f9eb581dd698755cbcfbc463c558a33619337","observation_id":"7d184ec9-a614-44d1-9d6e-77637ec80642","resolution":{"observed_at":"2026-08-11T04:32:51.560902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.497404Z","title":"Accelerated gradient descent escapes saddle points faster than gradient descent","venue":null,"work_id":"168f5bf3-6145-4a56-82dd-b97664f483d2","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.565463Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:9e8f64491cf5373e668cdf7461fb1e34476679a8e3ba1e3f8d969d9e0f308c8e","observation_id":"7263299a-421f-4890-a740-8bd513a78528","resolution":{"observed_at":"2026-08-11T04:32:52.502230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.482506Z","title":"When do flat minima optimizers work? Advances in Neural Information Processing Systems, 35: 0 16577--16595, 2022","venue":null,"work_id":"d6798f8d-1292-4665-bb5f-be4002405cb7","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.569847Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:64303f3cd3333143bf7c20c68a2974d5645515063bb7c39303ae72a85d365f97","observation_id":"a6f35c34-45e8-4b14-9670-3b99c6125429","resolution":{"observed_at":"2026-08-11T04:32:52.487670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.574461Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.574461Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:add4fe4bd1ae794574df9a1defdec37ad3c5896ceb43eceacbd2c9547363f57e","observation_id":"7b8c6740-d399-4905-bb27-e6d35965332b","resolution":{"observed_at":"2026-08-11T04:32:51.574461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.578900Z","title":"Learning multiple layers of features from tiny images","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.578900Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:2f5da4362e0da8acc272c4940e1c00f2c0c45d0176438b6d2cb71b3d989780d9","observation_id":"ae6f4b69-6fed-4b7a-aa06-25f565a711c5","resolution":{"observed_at":"2026-08-11T04:32:51.578900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.11958","last_updated":"2024-10-24T23:03:41Z","snapshot_observed_at":"2026-08-10T17:19:36.793903Z","submitted_at":"2023-08-23T06:57:05Z","title":"Maintaining Plasticity in Continual Learning via Regenerative Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.11958","snapshot_observed_at":"2026-08-11T04:32:51.583221Z","title":"Maintaining plasticity in continual learning via regenerative regularization","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.583221Z"},"links":{"cited_paper":"/paper/2308.11958","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:f5bf895f0d6bbdaa5c13a2ce492a255131e2c323e32a82cd38af5b15ee52634e","observation_id":"f2e23cf0-b37e-49c4-b6c6-685bf6d3bb70","resolution":{"observed_at":"2026-08-11T04:32:51.583221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06811","last_updated":"2024-10-27T23:45:38Z","snapshot_observed_at":"2026-08-12T06:39:05.824150Z","submitted_at":"2024-06-10T21:34:43Z","title":"Learning Continually by Spectral Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06811","snapshot_observed_at":"2026-08-11T04:32:51.588142Z","title":"Learning continually by spectral regularization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.588142Z"},"links":{"cited_paper":"/paper/2406.06811","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c3ff48475d81dc77403af5eac5ca91b73f8af1647d144ec4dfaa4f2123454250","observation_id":"2fb49840-e9bd-49c1-9ecf-492854a9de09","resolution":{"observed_at":"2026-08-11T04:32:51.588142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.593008Z","title":"Learning without forgetting","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.593008Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:075b136d9a3ea14cdbe63fab049ad0ce62cd2780e976d026e768d413cb0d1bf2","observation_id":"dec1ceb5-15da-4a3e-ae10-03b0e844546e","resolution":{"observed_at":"2026-08-11T04:32:51.593008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.437978Z","title":"The clear benchmark: Continual learning on real-world imagery","venue":null,"work_id":"d07db64b-d989-417a-9cef-3184f38a88bd","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.597438Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:2a6953481d501db34f660a2bcbce36cba413457fb2ca56b8fb7553a2374f421a","observation_id":"5ffebe9f-e5eb-43ce-8219-2c3620fda60d","resolution":{"observed_at":"2026-08-11T04:32:52.443659Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.422277Z","title":"An improved analysis of stochastic gradient descent with momentum","venue":null,"work_id":"badf497a-b8cb-4228-a0d8-b763bc325034","year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.601850Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:4b5320028d24e202c71d804db911ddd148f1fae35884ad00e16a6d6f42cff184","observation_id":"b6d15204-6323-4b25-83a8-50444d955f57","resolution":{"observed_at":"2026-08-11T04:32:52.427027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1804.00325","last_updated":"2019-05-01T14:09:52Z","snapshot_observed_at":"2026-07-06T06:31:14.582990Z","submitted_at":"2018-04-01T17:53:03Z","title":"Aggregated Momentum: Stability Through Passive Damping","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.00325","snapshot_observed_at":"2026-08-11T04:32:51.606150Z","title":"Aggregated momentum: Stability through passive damping","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.606150Z"},"links":{"cited_paper":"/paper/1804.00325","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:48ca7d5c116ae05cb8ede5e681543598de2f12f46b6e1188ff201d78fdf8c3ce","observation_id":"c00b0143-3083-426e-bbe1-c07367600d46","resolution":{"observed_at":"2026-08-11T04:32:51.606150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01800","last_updated":"2024-07-01T20:58:01Z","snapshot_observed_at":"2026-08-09T13:47:24.153200Z","submitted_at":"2024-07-01T20:58:01Z","title":"Normalization and effective learning rates in reinforcement learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01800","snapshot_observed_at":"2026-08-11T04:32:51.611027Z","title":"Normalization and effective learning rates in reinforcement learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.611027Z"},"links":{"cited_paper":"/paper/2407.01800","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:c617e9e85bffcb7b31cec54725a79e36303bb089fb1e82f774f39500ccc96696","observation_id":"2c8b0a50-84f4-4296-b9df-2e0846699123","resolution":{"observed_at":"2026-08-11T04:32:51.611027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18762","last_updated":"2024-02-29T00:02:33Z","snapshot_observed_at":"2026-08-10T17:19:20.560168Z","submitted_at":"2024-02-29T00:02:33Z","title":"Disentangling the Causes of Plasticity Loss in Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18762","snapshot_observed_at":"2026-08-11T04:32:51.615662Z","title":"Disentangling the causes of plasticity loss in neural networks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.615662Z"},"links":{"cited_paper":"/paper/2402.18762","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:5dfb1f5a7dd39406f3d0d3dcfe54644cefd25266436198719d6cdf14361a211b","observation_id":"8175a7f3-e989-4ff1-8817-f7e9d5cf2781","resolution":{"observed_at":"2026-08-11T04:32:51.615662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.406525Z","title":"The wikitext long term dependency language modeling dataset","venue":null,"work_id":"a9fe0f92-7d80-4f1a-becb-bde693b96455","year":2016},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.620235Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:9f75dbdf36f4f2f8a9a89652f30595d426d58d6f5eca0ce403dde09c99026184","observation_id":"61973c33-69e1-437b-9906-5e41d8b08a19","resolution":{"observed_at":"2026-08-11T04:32:52.411629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.07316","last_updated":"2023-03-19T13:37:01Z","snapshot_observed_at":"2026-07-06T14:04:58.943383Z","submitted_at":"2022-10-13T19:42:08Z","title":"MTEB: Massive Text Embedding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.07316","snapshot_observed_at":"2026-08-11T04:32:51.624772Z","title":"Mteb: Massive text embedding benchmark","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.624772Z"},"links":{"cited_paper":"/paper/2210.07316","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:75a76bc2127a8f4ff77e118fbc6d6e81562dbf4ec94da6ba75b9209d0e24df2e","observation_id":"25ba4763-e529-4702-84cf-0aa7b412f240","resolution":{"observed_at":"2026-08-11T04:32:51.624772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.390040Z","title":"A method for solving the convex programming problem with convergence rate O (1/k^2)","venue":null,"work_id":"a840970e-6525-4dab-b828-6ac5ba3c45c4","year":1983},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.629958Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:4b4955057faeb06025949ea03f04e3c94d118d04e2ce167d845491aabf4d9aa2","observation_id":"b6f22a7f-d96e-4b2f-8e87-6f9568e5a13f","resolution":{"observed_at":"2026-08-11T04:32:52.394814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.374273Z","title":"Reading digits in natural images with unsupervised feature learning, 2011","venue":null,"work_id":"349a4627-16af-4c1a-83e1-d81b384ae4d2","year":2011},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.634257Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:0c5944082bfb1462eaa18f1e7836c06d92395d6170c79546335a3114fe1992ae","observation_id":"217bbaaf-e509-49d0-976d-a36ca2a39a46","resolution":{"observed_at":"2026-08-11T04:32:52.379517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.08242","last_updated":"2023-08-15T07:43:44Z","snapshot_observed_at":"2026-08-12T06:39:39.608120Z","submitted_at":"2022-06-16T15:22:39Z","title":"Catastrophic overfitting can be induced with discriminative non-robust features","version":2},"cited_work":{"arxiv_id":"2206.08242","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.08242","snapshot_observed_at":"2026-08-11T04:32:52.001952Z","title":"Catastrophic overfitting can be induced with discriminative non-robust features","venue":"cs.LG","work_id":"58ba2cfa-0f5f-46e2-bf22-f05111d8053c","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.638508Z"},"links":{"cited_paper":"/paper/2206.08242","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:9263369d73c50d0185683c01ff9f9dbb43c455c9d6a9cc27d2b21fa426d3ed81","observation_id":"5c528bdb-0146-4321-8c6f-c43e1a3e9390","resolution":{"observed_at":"2026-08-11T04:32:52.009051Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.358926Z","title":"Some methods of speeding up the convergence of iteration methods","venue":null,"work_id":"af0f3c82-9ced-4c5a-b821-962612d75391","year":1964},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.643170Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:09963ae46d46be7469e81f14947a9737c11e096ef70b0cc1b5a93aa05868d7de","observation_id":"6f6a3089-945a-47cb-b18e-b42977f5a354","resolution":{"observed_at":"2026-08-11T04:32:52.363836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.647768Z","title":"On the momentum term in gradient descent learning algorithms","venue":null,"work_id":null,"year":1999},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.647768Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:155ecabdf15e69bfe41521da683a6cc18d0db499e2f9a4cc7b945ff82eca8b3f","observation_id":"755b0160-f74d-4607-92ec-fd61ec593859","resolution":{"observed_at":"2026-08-11T04:32:51.647768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2105.10190","last_updated":"2023-09-09T10:53:50Z","snapshot_observed_at":"2026-08-12T06:39:11.422472Z","submitted_at":"2021-05-21T08:00:53Z","title":"AngularGrad: A New Optimization Technique for Angular Convergence of Convolutional Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2105.10190","snapshot_observed_at":"2026-08-11T04:32:51.652153Z","title":"Angulargrad: A new optimization technique for angular convergence of convolutional neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.652153Z"},"links":{"cited_paper":"/paper/2105.10190","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:d0b380d806844caf3a917c50900ec174b4ebc9aa93e57ecfbb81c25355180885","observation_id":"7953ca69-a6e8-4a5f-8234-f6516e50ab1c","resolution":{"observed_at":"2026-08-11T04:32:51.652153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.334383Z","title":"The dormant neuron phenomenon in deep reinforcement learning","venue":null,"work_id":"6a60dc60-e8ea-4bbf-96d8-9ce1e849ce8a","year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.656628Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:da12a807647a376dfc961768216eb87967fe62df967bc80cc14e61010414fdfa","observation_id":"df1aedab-aced-4f73-957a-8905c0d8e024","resolution":{"observed_at":"2026-08-11T04:32:52.339338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.660773Z","title":"On the importance of initialization and momentum in deep learning","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.660773Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a52bb84eaaecf294920497bdcf9b65cf2770ab575290d25f1d6fe70ddd52a167","observation_id":"a2224b0d-2151-435d-9d8f-15c995c1b950","resolution":{"observed_at":"2026-08-11T04:32:51.660773Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.310446Z","title":"Inversion of friction anisotropy in a bio-inspired asymmetrically structured surface","venue":null,"work_id":"6a45785a-d07c-4288-bf5f-2fa79b83fbe6","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.665253Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:3bd8533c48f4018f14a2b048ee37211f5bccb604d4f557a1d95eb8b6383fd67a","observation_id":"8c90a804-6b02-4144-8b50-96974e23cbf2","resolution":{"observed_at":"2026-08-11T04:32:52.315147Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.295001Z","title":"Better sgd using second-order momentum","venue":null,"work_id":"7680e456-7f31-4d33-9098-f7c09dbdba0b","year":2022},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.669343Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a93bd1cfc1300672bbb13e8fc1af974d93f626ac5a777537abc0681f14d9738d","observation_id":"dfcc0275-2b6c-4a48-b236-8a9c253d61cd","resolution":{"observed_at":"2026-08-11T04:32:52.299851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.673603Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.673603Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:4bc93ddacb377a63f99e382674a9ebdc47b6eb7ad85d4f2a1a767aec9fb8d634","observation_id":"ab82cc83-783f-41f6-b879-673412ee39ed","resolution":{"observed_at":"2026-08-11T04:32:51.673603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.269594Z","title":"Positive-negative momentum: Manipulating stochastic gradient noise to improve generalization","venue":null,"work_id":"a1ef1356-2de7-4976-b547-5c4972e3b070","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.677949Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:7fc4b1f1fe8add6eefd2480ff07807df7f8e83f6ae603bb41b08e95dc88569b5","observation_id":"1a4afe6a-b45a-472a-844a-b05009045140","resolution":{"observed_at":"2026-08-11T04:32:52.275319Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.254518Z","title":"A walk with sgd: How sgd explores regions of deep network loss? 2018","venue":null,"work_id":"56a03b3e-5bb6-441a-9927-03cb6e926545","year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.682636Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:4442b45c2642602b5be5dc75e4aa680efa55c597eceaca5deda30d660a17ce53","observation_id":"b55a78a0-717b-4b79-b3e1-2bfb0fac7a00","resolution":{"observed_at":"2026-08-11T04:32:52.259769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.10396","last_updated":"2018-08-30T17:00:03Z","snapshot_observed_at":"2026-08-08T07:56:38.386325Z","submitted_at":"2018-08-30T17:00:03Z","title":"A Unified Analysis of Stochastic Momentum Methods for Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.10396","snapshot_observed_at":"2026-08-11T04:32:51.686959Z","title":"A unified analysis of stochastic momentum methods for deep learning","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.686959Z"},"links":{"cited_paper":"/paper/1808.10396","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:055198806009d6c52eba2ce93caa397908626f9bf3500bb50e0308acd3853474","observation_id":"138159cb-03ac-4688-809d-32e2a7b6d802","resolution":{"observed_at":"2026-08-11T04:32:51.686959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.238979Z","title":"Adahessian: An adaptive second order optimizer for machine learning","venue":null,"work_id":"c02ceabc-1ed7-4c67-8b32-66a457b54dfe","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.691514Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:1ee5a908c0ff6766d1b5d1dd0bde772c79e61ef07134f56464f4bc5f6d545896","observation_id":"8ecab353-652a-41fa-af12-1dc2a3e3264f","resolution":{"observed_at":"2026-08-11T04:32:52.244188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.11881","last_updated":"2020-02-10T22:58:53Z","snapshot_observed_at":"2026-08-12T06:39:06.981787Z","submitted_at":"2019-05-28T15:23:12Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.11881","snapshot_observed_at":"2026-08-11T04:32:51.695893Z","title":"Why gradient clipping accelerates training: A theoretical justification for adaptivity","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.695893Z"},"links":{"cited_paper":"/paper/1905.11881","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:a6cc973d0e63c88b572aa5b626df8abef394b0bc6dab1595913277a465f1dcf5","observation_id":"b2b9cbc5-d0bb-462a-885d-3428c5d5359c","resolution":{"observed_at":"2026-08-11T04:32:51.695893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.700685Z","title":"Link prediction based on graph neural networks","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.700685Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:6a1663319fa0b669d1dfa9c754512cf282b1de8a42d0991f9343a39548e85785","observation_id":"925b7c6e-64a5-470d-8793-aa8cdd3b4468","resolution":{"observed_at":"2026-08-11T04:32:51.700685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.214228Z","title":"Do you remember? overcoming catastrophic forgetting for fake audio detection","venue":null,"work_id":"fdbdc429-21b2-4636-af7f-ff02eb860400","year":2023},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.705046Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:f56b982144558a8c1f3a53cb189d15536637ce04d10092484ea1ae719d969c60","observation_id":"d1de11b6-8765-4cf8-86c9-c1bedf90187d","resolution":{"observed_at":"2026-08-11T04:32:52.219030Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:52.198788Z","title":"A robustly optimized BERT pre-training approach with post-training","venue":null,"work_id":"c25f6c3a-36aa-41e8-826b-0662230fb946","year":2021},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.709277Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:13efd3c36f7eebadc0705ec0d22a40b992b4550efbfa65bc622b42724629b3c6","observation_id":"c00850af-dca4-45e9-9ad4-0073426e263a","resolution":{"observed_at":"2026-08-11T04:32:52.204141Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.04839","last_updated":"2021-06-13T21:13:02Z","snapshot_observed_at":"2026-08-12T06:38:28.358146Z","submitted_at":"2020-02-12T08:28:19Z","title":"LaProp: Separating Momentum and Adaptivity in Adam","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.04839","snapshot_observed_at":"2026-08-11T04:32:51.721031Z","title":"Laprop: Separating momentum and adaptivity in adam","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.721031Z"},"links":{"cited_paper":"/paper/2002.04839","citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:0a252c38f7f458d385331c5d1ebf0d38321a50f0fb88e75be2243c020c79bf7e","observation_id":"4e1cf77f-4fcd-4d09-9f0c-9bab39568898","resolution":{"observed_at":"2026-08-11T04:32:51.721031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.727122Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.727122Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:8dd4085b7d3e2291abd1356037c195c392c2dde176b2ae295cfea04debfed170","observation_id":"7a323d30-51ae-46d6-925d-4f350233341b","resolution":{"observed_at":"2026-08-11T04:32:51.727122Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.732010Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.732010Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:dda75a09b9017028f6169e6fbf1f77561e73e19c0ff954c3f7a9e727549f0801","observation_id":"77fe1f1f-72f5-42bf-bcbf-fccb2413c9b4","resolution":{"observed_at":"2026-08-11T04:32:51.732010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T04:32:51.736857Z","title":"ǌd G ( 1 O.fT GS","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T04:32:51.736857Z"},"links":{"citing_paper":"/paper/2412.18790"},"observation_digest":"sha256:301daeb47ad521a7ae85d7c27003ba9dde88cadbd2cbdaca085738d1efe4108e","observation_id":"907ca412-399e-4e40-a891-32422d88bf4f","resolution":{"observed_at":"2026-08-11T04:32:51.736857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.18790","last_updated":"2024-12-25T05:58:07Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-12T06:39:00.033987Z","submitted_at":"2024-12-25T05:58:07Z","title":"Torque-Aware Momentum"},"reference_resolution":{"displayed":53,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":53},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 53 of 53 outbound references and 1 inbound Pith citation observation for arXiv:2412.18790."}