{"as_of":"2026-08-08T02:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d8c84e0f17f595efda6f7f5639ddd2b4a2345c3bc75c7976b7a9074ec8aa25e9","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":26,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":26,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":26,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":26,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:35:40.098289Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T19:30:07.293501Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2502.07529","last_updated":"2025-06-06T13:42:19Z","snapshot_observed_at":"2026-08-03T03:50:14.086851Z","submitted_at":"2025-02-11T13:10:34Z","title":"Training Deep Learning Models with Norm-Constrained LMOs","version":2},"reference_index":159,"source":"arxiv_source","source_observed_at":"2026-05-21T21:22:36.870292Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2502.07529"},"observation_digest":"sha256:ad1d37c18389744d19ab84309ab4f141f648336fcb518ba6ff48abe210b103db","observation_id":"a2a3852c-5027-443b-9386-3ce4e941ed6d","resolution":{"observed_at":"2026-05-21T21:22:37.015602Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-06T18:35:40.098289Z","title":"Modular duality in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08091","last_updated":"2025-07-10T18:04:52Z","snapshot_observed_at":"2026-08-06T18:25:24.570454Z","submitted_at":"2025-07-10T18:04:52Z","title":"Low-rank Momentum Factorization for Memory Efficient Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T18:35:40.098289Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2507.08091"},"observation_digest":"sha256:c9fb2163b91d0b6fd00756c96182d68e18b759d1752d6129797f190d41c857a2","observation_id":"3fe12a6e-83c1-43dd-9681-700cffe0ce6e","resolution":{"observed_at":"2026-08-06T18:35:40.098289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2510.10777","last_updated":"2026-05-16T11:31:52Z","snapshot_observed_at":"2026-07-06T22:32:27.698678Z","submitted_at":"2025-10-12T19:39:41Z","title":"Preconditioned Norms: A Unified Framework for Steepest Descent, Quasi-Newton and Adaptive Methods","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-21T21:05:49.844436Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2510.10777"},"observation_digest":"sha256:5ccedf9c37b7b9bb8b1a8f69ebd8c1d526e3eab635d07fb327ea49e831d5ff5c","observation_id":"e00d30f1-c896-45e8-ba9c-a7ccd1f43fe1","resolution":{"observed_at":"2026-05-21T21:10:38.704244Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-03T03:56:38.947343Z","title":"and Newhouse, L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2602.06880","last_updated":"2026-05-26T21:42:43Z","snapshot_observed_at":"2026-08-06T08:00:52.329755Z","submitted_at":"2026-02-06T17:06:42Z","title":"Decoupling Variance and Scale-Invariant Updates in Adaptive Gradient Descent for Unified Vector and Matrix Optimization","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T03:56:38.947343Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2602.06880"},"observation_digest":"sha256:7be44aa92cb45568833febc2e617a90d0fc00d3f42df9b0d71d199260e270f05","observation_id":"930d441e-fe2f-4a3c-987e-6ee6a1291d18","resolution":{"observed_at":"2026-08-03T03:56:38.947343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2603.10067","last_updated":"2026-05-21T20:35:00Z","snapshot_observed_at":"2026-07-06T22:48:35.345421Z","submitted_at":"2026-03-10T02:12:24Z","title":"HTMuon: Improving Muon via Heavy-Tailed Spectral Correction","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-25T06:50:29.893126Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2603.10067"},"observation_digest":"sha256:fa771273493478abec36500d299b2b8d03176929c4c6b07ac916a0faa412d1e3","observation_id":"f9c45aab-3c14-4310-8aea-872a5b89da6f","resolution":{"observed_at":"2026-05-25T06:55:26.275684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-13T17:23:44.758186Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2603.26661","last_updated":"2026-07-01T17:46:52Z","snapshot_observed_at":"2026-07-13T17:23:44.301154Z","submitted_at":"2026-03-27T17:58:05Z","title":"GaussianGPT: Towards Autoregressive 3D Gaussian Scene Generation","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-13T17:23:44.758186Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2603.26661"},"observation_digest":"sha256:40a4a7f7f65adee0e51994ebd0cb342e23c8d2218b6fae009be30fa6219ad0e2","observation_id":"c0116fc5-4d2e-4979-9593-d089c92fb0c3","resolution":{"observed_at":"2026-07-13T17:23:44.758186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2604.17423","last_updated":"2026-05-01T14:46:49Z","snapshot_observed_at":"2026-08-02T20:20:49.115675Z","submitted_at":"2026-04-19T13:07:51Z","title":"A unified convergence theory for adaptive first-order methods in the nonconvex case, including AdaNorm, full and diagonal AdaGrad, Shampoo and Muo","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-10T07:19:59.335184Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2604.17423"},"observation_digest":"sha256:760ba796b4d1d5017d5046290d83d8c3cd2543abc5672d664a4d28db98b2a9ac","observation_id":"db426e5b-2fb2-4d34-bd53-a983ca87e1ae","resolution":{"observed_at":"2026-05-10T07:26:59.843993Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.06316","last_updated":"2026-05-07T14:16:16Z","snapshot_observed_at":"2026-08-03T22:01:24.808214Z","submitted_at":"2026-05-07T14:16:16Z","title":"Pro-KLShampoo: Projected KL-Shampoo with Whitening Recovered by Orthogonalization","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-08T13:06:05.234216Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.06316"},"observation_digest":"sha256:3b1928cc7c612db24b223cd471ab0793e41b00b345ac47f018ff7636d5302cba","observation_id":"2d37797a-e03f-4428-9578-ca93e927fb41","resolution":{"observed_at":"2026-05-11T19:01:13.028343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.07815","last_updated":"2026-05-08T14:47:56Z","snapshot_observed_at":"2026-07-06T23:20:11.042952Z","submitted_at":"2026-05-08T14:47:56Z","title":"OrScale: Orthogonalised Optimization with Layer-Wise Trust-Ratio Scaling","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-11T02:47:08.766380Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.07815"},"observation_digest":"sha256:d4e450e39f7445ed7d4cb285ab1f8185b5157990b623fbf07f6c70267774f9f1","observation_id":"05939d19-8bed-4420-aa10-1108901a159c","resolution":{"observed_at":"2026-05-11T03:05:55.574343Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.08949","last_updated":"2026-05-14T22:50:46Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:42:08Z","title":"Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-12T02:12:25.713592Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.08949"},"observation_digest":"sha256:acd4bfc994386e8c2ab1cd458ab3ff2b1b40ba3ea4cb306c009dbe1b3a49210f","observation_id":"5032579b-e852-48fe-b4d2-32b3f299236a","resolution":{"observed_at":"2026-05-12T02:16:16.351281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.08949","last_updated":"2026-05-14T22:50:46Z","snapshot_observed_at":"2026-07-06T23:21:06.773761Z","submitted_at":"2026-05-09T13:42:08Z","title":"Muon-OGD: Muon-based Spectral Orthogonal Gradient Projection for LLM Continual Learning","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-19T15:11:43.827012Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.08949"},"observation_digest":"sha256:e4798733e92b90f15034fcbabe645739a248ae08d24d926dd85c3785ae43c916","observation_id":"cea3ec6e-975a-4a7d-9a9f-0cd67e452abc","resolution":{"observed_at":"2026-05-19T15:12:37.509271Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.08980","last_updated":"2026-05-09T14:47:59Z","snapshot_observed_at":"2026-08-02T05:42:35.044950Z","submitted_at":"2026-05-09T14:47:59Z","title":"Muon Does Not Converge on Convex Lipschitz Functions","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-12T02:22:01.364777Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.08980"},"observation_digest":"sha256:a05daf52de8469f85a3f346b8cd4535bcac981f3cd191021071abf8e44e35af1","observation_id":"0c75b1d6-b680-493e-a7c3-8db89b406a4d","resolution":{"observed_at":"2026-05-12T07:41:39.538565Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.09238","last_updated":"2026-05-10T00:39:13Z","snapshot_observed_at":"2026-08-02T15:17:04.657553Z","submitted_at":"2026-05-10T00:39:13Z","title":"Intrinsic Muon: Spectral Optimization on Riemannian Matrix Manifolds","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-12T05:07:39.558349Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.09238"},"observation_digest":"sha256:43a5da8f2b4570a7415aac4e32699f1d7bbf3ca043355e9bd08415734762be95","observation_id":"f0a92b1b-bc02-4461-a8d5-d8205ee71d44","resolution":{"observed_at":"2026-05-12T05:36:26.332930Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.12492","last_updated":"2026-05-12T17:59:34Z","snapshot_observed_at":"2026-07-31T18:31:37.222688Z","submitted_at":"2026-05-12T17:59:34Z","title":"Pion: A Spectrum-Preserving Optimizer via Orthogonal Equivalence Transformation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T04:53:52.898843Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.12492"},"observation_digest":"sha256:b08f25100cee8747eb00eaa63a08b64d94cc9f74617a7111ec4350360d460bb6","observation_id":"22b56f48-9114-4ecb-82bc-b4684cbbd276","resolution":{"observed_at":"2026-05-13T04:57:17.587986Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.14200","last_updated":"2026-05-13T23:32:00Z","snapshot_observed_at":"2026-07-06T23:25:39.415637Z","submitted_at":"2026-05-13T23:32:00Z","title":"How to Scale Mixture-of-Experts: From muP to the Maximally Scale-Stable Parameterization","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-15T04:45:20.091598Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.14200"},"observation_digest":"sha256:e0d4000ea7a6b4c4777ebab7d504bd50b109e8dbbbd2b7865371620152c27a6b","observation_id":"6af8c644-af95-4eac-be6f-c0dd6148f0e0","resolution":{"observed_at":"2026-05-15T04:49:44.879652Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2605.16341","last_updated":"2026-05-07T23:37:37Z","snapshot_observed_at":"2026-07-06T23:27:29.931962Z","submitted_at":"2026-05-07T23:37:37Z","title":"Orth-Dion: Eliminating Geometric Mismatch in Distributed Low-Rank Spectral Optimization","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T22:23:04.489609Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2605.16341"},"observation_digest":"sha256:39c5bb05d8f36653a33c503276602fe39b0395e0d479e780989fb39b2415d8e3","observation_id":"1f35a431-1ba4-40b5-bb84-723b7c000f67","resolution":{"observed_at":"2026-05-20T22:23:47.614326Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2606.01787","last_updated":"2026-06-01T07:08:32Z","snapshot_observed_at":"2026-08-02T19:16:44.439836Z","submitted_at":"2026-06-01T07:08:32Z","title":"Stochastic convergence of parallel asynchronous adaptive first-order methods","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T14:27:48.433313Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2606.01787"},"observation_digest":"sha256:d4e9b3163c42de38266c83300b3c1120090cbc024780d8d73b4376f8bbd3cf75","observation_id":"d94318c5-ba2a-41b8-84c9-77de146f909a","resolution":{"observed_at":"2026-07-01T23:16:24.970235Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2606.04662","last_updated":"2026-06-03T09:40:30Z","snapshot_observed_at":"2026-07-06T23:44:42.700120Z","submitted_at":"2026-06-03T09:40:30Z","title":"Why Muon Outperforms Adam: A Curvature Perspective","version":1},"reference_index":125,"source":"arxiv_source","source_observed_at":"2026-06-28T07:04:21.012269Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2606.04662"},"observation_digest":"sha256:4a253f6a766701335dcce337c34bbf44e64d9e18d89ac73a827d80e122a9ef1e","observation_id":"74080cf3-bf21-4c9d-98ac-f0a235cdc9ee","resolution":{"observed_at":"2026-07-02T07:06:44.919762Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2606.25342","last_updated":"2026-06-24T03:14:20Z","snapshot_observed_at":"2026-07-06T23:59:47.542695Z","submitted_at":"2026-06-24T03:14:20Z","title":"Lifelong In-Context Learning with Transformers Requires Parametric Forms of Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-25T21:19:30.138022Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2606.25342"},"observation_digest":"sha256:986ddd6cfaf2437f4c00d851170c97fbafe8876c6d487f08ba4930708d731f3a","observation_id":"e51a6a11-9b07-4631-9ac8-f32a7f4c1236","resolution":{"observed_at":"2026-07-04T19:30:07.295201Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2606.29176","last_updated":"2026-06-28T03:44:59Z","snapshot_observed_at":"2026-08-06T07:39:35.931864Z","submitted_at":"2026-06-28T03:44:59Z","title":"Dead-Direction Conditioners: Gauge-Equivariant Preconditioning for Deep Networks","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-30T07:58:57.890346Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2606.29176"},"observation_digest":"sha256:2fc60c117a6665ce51a817662767eca49d4b209c85f169d02fc4ae5b743e7089","observation_id":"c0f5a01f-11f3-4852-b61f-a9c78ecb7727","resolution":{"observed_at":"2026-06-30T08:04:28.174134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":"2410.21265","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-04T19:30:07.293501Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265","venue":null,"work_id":"69974f70-20f2-4705-a359-53fe8093a2f3","year":2024},"citing_paper":{"arxiv_id":"2607.01455","last_updated":"2026-07-15T02:52:22Z","snapshot_observed_at":"2026-08-06T17:57:36.341425Z","submitted_at":"2026-07-01T20:21:03Z","title":"Token Geometry","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-03T21:08:26.712950Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.01455"},"observation_digest":"sha256:a934a1eac1963d7521ed7312ad89cd03b70762a5690275f4426a063c6f1a8675","observation_id":"8566f835-0bb8-4445-bcd8-5b67c161c980","resolution":{"observed_at":"2026-07-03T21:08:57.423707Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-07-12T08:48:22.161005Z","title":"Modular duality in deep learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.01455","last_updated":"2026-07-15T02:52:22Z","snapshot_observed_at":"2026-08-06T17:57:36.341425Z","submitted_at":"2026-07-01T20:21:03Z","title":"Token Geometry","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-12T08:48:22.161005Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.01455"},"observation_digest":"sha256:5efdf2b89bd01b8443e6b7cca9a607802fdb1b19aa1479f3438654eb4dc20c42","observation_id":"9730bbcb-219e-4d03-bd52-e9e427275bec","resolution":{"observed_at":"2026-07-12T08:48:22.161005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-02T05:49:24.942195Z","title":"arXiv preprint arXiv:2410.21265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-02T05:49:24.942195Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:506a3de9ab90fb9ac9e5a3bdc2e3865f41de8d36cc9387bda153df3bfdc2e39e","observation_id":"130d9530-7a86-475b-8cf2-b4a381aa0fd3","resolution":{"observed_at":"2026-08-02T05:49:24.942195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-04T04:23:00.756777Z","title":"arXiv preprint arXiv:2410.21265 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.13246","last_updated":"2026-08-01T19:18:42Z","snapshot_observed_at":"2026-08-07T16:33:22.195520Z","submitted_at":"2026-07-14T20:21:38Z","title":"Reassessing Muon for Matrix Factorization","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-04T04:23:00.756777Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.13246"},"observation_digest":"sha256:b228b2ceb501b043d4cc518a56bf0e058bde14f6abe91cf5f666b26d28b8e7dd","observation_id":"3773977a-28d1-4cee-b341-83bd46971ade","resolution":{"observed_at":"2026-08-04T04:23:00.756777Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-02T06:45:13.333343Z","title":"Modular duality in deep learning.arXiv preprint arXiv:2410.21265, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-06T06:09:03.498548Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:13.333343Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:447556e5ec65bcdfbab5fe6f5a89e46a8456491c2f8b03b050d099a992326fb7","observation_id":"9344d4b5-482f-4669-bde0-23ea357f164f","resolution":{"observed_at":"2026-08-02T06:45:13.333343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21265","snapshot_observed_at":"2026-08-05T05:27:17.610179Z","title":"Modular duality in deep learning,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.03941","last_updated":"2026-08-04T17:10:47Z","snapshot_observed_at":"2026-08-07T23:12:42.972467Z","submitted_at":"2026-08-04T17:10:47Z","title":"Muon Meets Mamba: Spectral Optimization for State Space Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T05:27:17.610179Z"},"links":{"cited_paper":"/paper/2410.21265","citing_paper":"/paper/2608.03941"},"observation_digest":"sha256:631a9a32e53aef526d87fbcddabace7234b10bf59107070fdf12888807f594b0","observation_id":"6e03d072-2279-4b47-86ce-f4814c5d1017","resolution":{"observed_at":"2026-08-05T05:27:17.610179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2410.21265/citation-record","integrity":"/paper/2410.21265/integrity","json":"/paper/2410.21265/citation-record.json","paper":"/paper/2410.21265"},"outbound":[],"paper":{"arxiv_id":"2410.21265","last_updated":"2024-12-06T17:02:28Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-03T01:16:50.130450Z","submitted_at":"2024-10-28T17:57:31Z","title":"Modular Duality in Deep Learning"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 26 inbound Pith citation observations for arXiv:2410.21265."}