{"as_of":"2026-08-06T01:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:15d5b36453066f91c074660bec12e5527933b52160ec924e4a1c09320aff451e","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T19:15:49.229099Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.26842/citation-record","integrity":"/paper/2605.26842/integrity","json":"/paper/2605.26842/citation-record.json","paper":"/paper/2605.26842"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2504.05295","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T21:35:37.653099Z","title":"Dion: Distributed Orthonormalized Updates","venue":null,"work_id":"4ecfbe15-0efd-41f4-a129-82f6a2164d2f","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:ee7cea28b11b667277a58302fc4584792e366a5f54b62e65ff7ff9ea7504b727","observation_id":"b22e087e-ecab-4463-afc2-c2827e173236","resolution":{"observed_at":"2026-06-29T19:23:54.125287Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17387","last_updated":"2025-02-24T18:14:01Z","snapshot_observed_at":"2026-08-03T16:01:59.567237Z","submitted_at":"2025-02-24T18:14:01Z","title":"Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models","version":1},"cited_work":{"arxiv_id":"2502.17387","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.17387","snapshot_observed_at":"2026-07-04T16:39:58.415508Z","title":"Big-math: A large-scale, high-quality math dataset for reinforcement learning in language models","venue":null,"work_id":"00edb0c5-3c62-421d-a532-03e2594f1dba","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2502.17387","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:d04e0396fc026fba3919d41124c0c93e89ca865f6a9c0ea1ae9c2fd09baefd17","observation_id":"1dbdf28d-a2cf-4b39-84ba-34d5fe2097de","resolution":{"observed_at":"2026-06-29T19:23:54.125590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:1199a81e0130b392d361d4812bee076bb4362c152d54a7a936a24bdb78d5314e","observation_id":"077d95c3-c457-49f0-97ba-b90c1c404c0f","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:f8c4fd9da550891bd2205aa466dc2e6559df5cfb7e61591b5518e9e98401a89a","observation_id":"2a95a81f-c675-4e77-85ce-ec12b2e03368","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:68f573e83ff3cde771f2933b2dcfca72c9e4db80370efc908490c301d9b0d71b","observation_id":"ee3bbbf6-c9af-4056-b3e4-aba4157ffb61","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05019","last_updated":"2025-05-29T04:25:16Z","snapshot_observed_at":"2026-07-06T17:56:49.318298Z","submitted_at":"2024-04-07T17:17:23Z","title":"Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts","version":3},"cited_work":{"arxiv_id":"2404.05019","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.05019","snapshot_observed_at":"2026-06-29T19:23:54.128784Z","title":"Shortcut-connected expert parallelism for accelerating mixture-of-experts","venue":null,"work_id":"190c67f2-7d8f-48c0-af65-75443b7d0920","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2404.05019","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:dc08037e3cb8f393c2f0c7fef100c119c9a09239a930126cefb059af6e000d87","observation_id":"32feb5ce-7ebc-45a8-9254-9b3bb704d926","resolution":{"observed_at":"2026-06-29T19:23:54.130290Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.08227","last_updated":"2022-12-19T10:30:12Z","snapshot_observed_at":"2026-07-06T13:42:40.131502Z","submitted_at":"2022-08-17T11:16:52Z","title":"MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation","version":4},"cited_work":{"arxiv_id":"2208.08227","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2208.08227","snapshot_observed_at":"2026-07-02T22:17:25.584510Z","title":"Multipl-e: A scalable and extensible approach to benchmarking neural code generation","venue":null,"work_id":"eb2a6abe-2ae0-4366-96e5-78fe4c32cc33","year":2022},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2208.08227","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:f6d7699f2d009c5d461394861ee752fe44e4c75e2f319a4998ca9d533d6928ef","observation_id":"090c46dc-5e5f-4efd-bf25-0dc56501c3f1","resolution":{"observed_at":"2026-06-29T19:23:54.143475Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:a299b6b0934d05d53d971a984eb003838f30f66f12ca854dfcddd5ae4d834101","observation_id":"84a148f3-8882-49d5-8536-267aa31d2c86","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.00535","last_updated":"2025-05-12T10:24:14Z","snapshot_observed_at":"2026-07-06T19:59:28.832182Z","submitted_at":"2024-11-30T16:58:42Z","title":"FullStack Bench: Evaluating LLMs as Full Stack Coders","version":6},"cited_work":{"arxiv_id":"2412.00535","doi":"10.48550/arxiv.2412.00535","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.00535","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fullstackbench: Evaluatingllmsasfullstackcoders","venue":"arXiv (Cornell University)","work_id":"569bc5cb-f61d-4b46-8553-07cf2b67cece","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2412.00535","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:03240d7a3a0bccebeb1cbb5233723c2c415c27f8881190c84c50e7cf50ffcd6d","observation_id":"7bb56558-e906-442b-a332-b3fcc8b46601","resolution":{"observed_at":"2026-06-29T19:23:54.161758Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":"2110.14168","doi":"10.1002/j.1545-","metadata_source":"pith","pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Training Verifiers to Solve Math Word Problems","venue":"cs.LG","work_id":"acab1aa8-b4d6-40e0-a3ee-25341701dca2","year":2021},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:5e9f654eba45d2c3478474f65de8409c6dfb1b5e2ea67af56535734fb371c9e3","observation_id":"3345df67-ae38-4c38-be6a-81e5232a55a1","resolution":{"observed_at":"2026-06-29T19:23:54.206671Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:449ab5112f0861a0d72bb043364fb4d84460dc8cc9fc33983cb5a82f7cd82de3","observation_id":"1b8d3fbe-4b69-4449-ac97-f4f2e940ef4e","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:fd0c4b6042c24c742d44fe01119d5dcad4b23a303e507460d841a59ff716ddd1","observation_id":"10046867-b00a-4aed-9eff-95ad6be94932","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.02239","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:23:54.199807Z","title":null,"venue":null,"work_id":"ca436b1a-149e-402e-ab97-dc2cda660283","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:a349c715fe4db30a20ed63339752ab368a79d44a62acc3a7a4b35ed08d1fd4dc","observation_id":"84de64fe-e08e-404f-9b28-2646f9494065","resolution":{"observed_at":"2026-06-29T19:23:54.201938Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":"2401.03065","doi":"10.48550/arxiv.2401.03065","metadata_source":"pith","pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","venue":"cs.SE","work_id":"0daed386-84ea-40ec-bdeb-546f8991fca5","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:7f1052686921627e8e2793c250060952c39e486ec8862d376fef9d31681fe7e0","observation_id":"d311843c-b43e-439c-8c9b-2a596e4838e4","resolution":{"observed_at":"2026-06-29T19:23:54.188044Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:55becd81df5ce593bd6595e02986c17c14732ddcd9e9f7944fc728fef7e7619b","observation_id":"943daeb0-ddb2-461f-9e83-c737307667f7","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.20626","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T16:38:41.039569Z","title":"arXiv preprint arXiv:2511.20626 , year=","venue":null,"work_id":"ba262780-00f3-4016-9a23-e030aba1d13d","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:d33ef4c70d0ae90030e4a228408e388cb28739dc32b8423e2fdc7036055cb0cb","observation_id":"3f161f65-db91-4c9d-882b-59821c96be49","resolution":{"observed_at":"2026-06-29T19:23:54.188574Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":"2009.03300","doi":"10.48550/arxiv.2009.03300","metadata_source":"pith","pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Massive Multitask Language Understanding","venue":"cs.CY","work_id":"e87ec49a-544b-4ec8-8991-75298c64ff5e","year":2020},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:b343e8690c493255190c7007ab11fe84171fe692ac5e25b19cd28319eb9f46c0","observation_id":"b2dd5281-b407-41f5-8a5e-cc2e1973d8ce","resolution":{"observed_at":"2026-06-29T19:23:54.192731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-04T01:08:06.256034+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.03874","last_updated":"2021-11-08T21:30:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-03-05T18:59:39Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","version":2},"cited_work":{"arxiv_id":"2103.03874","doi":"10.48550/arxiv.2103.03874","metadata_source":"pith","pith_arxiv_id":"2103.03874","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Measuring Mathematical Problem Solving With the MATH Dataset","venue":"cs.LG","work_id":"50652ac6-fb7c-4675-a2c2-159c241feb17","year":2021},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2103.03874","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:56e2d8a763b82dc18554f70fdf090fe8b4a29b072667b3720526f19dbdc0a1f2","observation_id":"d681cac6-2b9a-496f-8398-342f540c2b07","resolution":{"observed_at":"2026-06-29T19:23:54.176488Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-14T18:20:22.649941+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:f2a4917c1327cc7c7ae1a87765dc34f5b06da99cac925155ad1941223ff55257","observation_id":"ee370763-3f96-4e8e-bcf2-3f2597c650fb","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":1991},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:ca908d9017d0b11c66914f7c3c78c4fbd2341e3e1931f7f0076baab925bdfda2","observation_id":"eb2f8f53-e214-4a2d-b19e-353102c86eb4","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:ed4683ada81225a9293c6153e2abc3a1f8f1f41e98d796f9ecaeb774a2c080b9","observation_id":"dc78544b-c3e2-4a04-8b94-f09856c4c3fc","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:5559bfe334c3f5a196ec87be343c3afd57480d44d94077b68f9b9ee1be2cc5b7","observation_id":"76d85295-f68d-482f-85c9-ed643ddf275d","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04836","last_updated":"2017-02-09T20:38:16Z","snapshot_observed_at":"2026-07-06T05:10:58.923264Z","submitted_at":"2016-09-15T20:03:06Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","version":2},"cited_work":{"arxiv_id":"1609.04836","doi":"10.48550/arxiv.1609.04836","metadata_source":"pith","pith_arxiv_id":"1609.04836","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima","venue":"cs.LG","work_id":"01efb355-7c12-4b89-bc42-91ee46ee276b","year":2016},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1609.04836","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:594da126fa99d77329bbcafc2ac472036bf704076fcabde2d7348a683aa6560e","observation_id":"54fef792-22cc-45ca-9e3c-a6fbe7536ce6","resolution":{"observed_at":"2026-06-29T19:23:54.180575Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.16981","doi":"10.48550/arxiv.2510.16981","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"arXiv preprint arXiv:2510.16981 , year=","venue":"ArXiv.org","work_id":"15052c26-b8e7-4957-ac0e-9af367d68fdf","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:dd72f431fa67bcdabd4196c33043a566904ca3599de3715b6db925bccfba1c15","observation_id":"7e9a34c3-a52c-4a5c-9bed-2bcde22dd4c9","resolution":{"observed_at":"2026-06-29T19:23:53.292274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:cc87fdf6534d0d09ac4b758c259786e5fddf8f75da4187579a9a7069694a31cc","observation_id":"df06e14b-dcaa-4a21-8a8c-f554708710c0","resolution":{"observed_at":"2026-06-29T19:23:54.168862Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:b1bf6b99c35ecb07665288c75daa41719e2628a6305e9208ca4741dc4752350e","observation_id":"086a5296-6a0e-41b1-bdef-472c626c33a6","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":"2306.09212","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-06-29T19:43:55.030793Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","venue":"cs.CL","work_id":"30c9ec62-1af0-4f30-94b4-d1ef163eff71","year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:31b2bae4eaaaf6489b4c9e45d1cb33e1c3e948252d7f47833861875754d71e16","observation_id":"fab01d20-92bf-4664-9b3c-46151b30de33","resolution":{"observed_at":"2026-06-29T19:23:54.171237Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":"2405.04434","doi":"10.1145/3593013.3594097","metadata_source":"pith","pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","venue":"cs.CL","work_id":"1e1df141-cac8-47fd-b068-c4c96e51e331","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:8ea6480c898af60588cbdaad5e021adbb8bc04974b9084879f2f954182a61483","observation_id":"217aa053-0051-44b5-8678-0ef536251222","resolution":{"observed_at":"2026-06-29T19:23:54.204328Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":"2412.19437","doi":"10.1016/j.neucom.2023.127063.url:https://www.sciencedirect","metadata_source":"pith","pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"DeepSeek-V3 Technical Report","venue":"cs.CL","work_id":"57d2791d-2219-4c31-a077-afc04b12a75c","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:518ff75e84c01c412aee04accb5ee71d06ca8e5b8cb37bbca39988e3d90b4396","observation_id":"8e924ddf-5bde-41ea-a53d-596c3440faf0","resolution":{"observed_at":"2026-06-29T19:23:54.177491Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.21204","doi":"10.48550/arxiv.2601.21204","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"& Cai, X","venue":"Open MIND","work_id":"3d8bee12-25ae-433a-bb2b-4c2e474a81de","year":2026},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:4addcddca4a4c21e14ba532c57ae7ab2dbaa46796a86f117cdc1c0d102712181","observation_id":"79e5b7f4-5747-43d2-8186-313bd40e6c04","resolution":{"observed_at":"2026-06-29T19:23:54.190449Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.06450","last_updated":"2024-08-12T18:59:13Z","snapshot_observed_at":"2026-07-06T18:59:51.988540Z","submitted_at":"2024-08-12T18:59:13Z","title":"Evaluating Language Models for Efficient Code Generation","version":1},"cited_work":{"arxiv_id":"2408.06450","doi":"10.48550/arxiv.2408.06450","metadata_source":"pith","pith_arxiv_id":"2408.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Evaluating language models for efficient code generation","venue":"cs.SE","work_id":"09560849-dba2-488c-9af2-3ca599c7f32f","year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2408.06450","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:35c9af00c23fbb718bbfb248f2d5c3f80d06652e9c50eb54191a29a2d606109d","observation_id":"feef782f-0f2e-428a-a4d7-bdc7c26cb5be","resolution":{"observed_at":"2026-06-29T19:23:54.195640Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:40.674264+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.16982","last_updated":"2025-02-24T09:12:29Z","snapshot_observed_at":"2026-08-02T00:32:51.000665Z","submitted_at":"2025-02-24T09:12:29Z","title":"Muon is Scalable for LLM Training","version":1},"cited_work":{"arxiv_id":"2502.16982","doi":"10.48550/arxiv.2502.16982","metadata_source":"pith","pith_arxiv_id":"2502.16982","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Muon is Scalable for LLM Training","venue":"cs.LG","work_id":"a818f37a-b985-49e6-879d-603a00525f65","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2502.16982","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:efdf925bdb61dcb8eb752a2eb7eb8809266841c1e6d5a1815e1e31e2f5d360d7","observation_id":"608c9a27-86ac-4a3e-9316-dac840a4281c","resolution":{"observed_at":"2026-06-29T19:23:54.198683Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":"1711.05101","doi":"10.1137/1.9781611972825.47","metadata_source":"pith","pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Decoupled Weight Decay Regularization","venue":"cs.LG","work_id":"07ef7360-d385-4033-83f7-8384a6325204","year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:48ac2394507a275389d37556dd60230f62490583cd91470ffbb3a435e974c088","observation_id":"4a37dacf-26de-4453-9d38-825bba520922","resolution":{"observed_at":"2026-06-29T19:23:54.208965Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:3afcdb0f9fc5092bca48bedc89e9a596c5495aecba82d1d530e6d6c5789fae14","observation_id":"9eafd766-6496-4d86-b655-d7fbf9a6b739","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:8b1534574fc33ab5c9b75f655302846de35a8c42289f8513d7e1f04a58c17013","observation_id":"5964b405-6ec4-453a-afaa-23cbf3bdea7a","resolution":{"observed_at":"2026-06-29T19:23:54.146743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:3cfd8697243578e1cf5f2f4e2eadba146da0e1f765cee5502c18a5ac2ff495db","observation_id":"413e8111-3bad-4183-9527-f44d49a6cfac","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":"2311.12022","doi":"10.48550/arxiv.2311.12022","metadata_source":"pith","pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","venue":"cs.AI","work_id":"9e2a976b-f5ad-4aee-af5c-243fe0fe75d2","year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:d88cf8e6dfbc72e4940ed28143761858173a3c55b3f110edc4835cc872797a15","observation_id":"40f403e9-74c7-482e-80a4-595ee2f3bb8b","resolution":{"observed_at":"2026-06-29T19:23:54.153752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:46.941438+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":1951},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:6321dfa769dc49a2f35b0359144079b7524bac36c0d391426de46fa1340063f1","observation_id":"1f0a1af9-c824-4388-8d9c-876cc8fed84e","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":"1907.10641","doi":"10.48550/arxiv.1907.10641","metadata_source":"pith","pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","venue":"cs.CL","work_id":"9587a902-54ad-434e-9cbc-bdfe54b5d3bf","year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:f8e0047961ab3c6b9d5c906c3793daf6750bcc05757f83be80a49e594d50a057","observation_id":"a2015213-337a-4bfc-bb6f-399e4a85d2fa","resolution":{"observed_at":"2026-06-29T19:23:54.156148Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:524df8d4b1840e5f3ac1de3ebca4850d5b08dbe2e7394b396f398941875fbf98","observation_id":"ca23e014-9892-4880-86a7-a9c669707b9c","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2507.11005","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T17:08:43.650075Z","title":"Adamuon: Adaptive muon optimizer.arXiv preprint arXiv:2507.11005","venue":null,"work_id":"574efac8-2f9d-4bb8-96a9-1fbdaf2b87ef","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:46a9df2560a15708e7fe0462ccdb03370df37e780c31a3128cb51b4e6ad65c1e","observation_id":"be02a92c-11a8-416e-b80c-a2011b1a6449","resolution":{"observed_at":"2026-06-29T19:23:54.159088Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:30bea8945ad45e6b9dc4501f3341ed58c16ec64fbdcc1bcafe62081361dce6a6","observation_id":"fa038fce-780c-4123-b676-f50b183f6330","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:5c157e3f08768a93ca317762b7aedeccbdf100e76c722c89b67249e9af1733c5","observation_id":"d7eafdea-592c-4ef8-969e-ef01ee2cd41a","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:06f883980ceaa48567f73c6bfd6aba17548f2972967bfebe60028ae951da7b9a","observation_id":"1d7fd369-0426-443c-947b-0ed058e9b073","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n19-1421","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/n19-1421","venue":null,"work_id":"628930d3-897c-43a2-8d6d-589da959e066","year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:95b7124079320761417794b26d07ac9876c264d4d77a4507759462f64c76c554","observation_id":"a46f17e8-76d9-4d07-8144-51ab48920d53","resolution":{"observed_at":"2026-06-29T19:23:53.289710Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:04.850966+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.20534","last_updated":"2026-02-03T04:57:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-28T05:35:43Z","title":"Kimi K2: Open Agentic Intelligence","version":2},"cited_work":{"arxiv_id":"2507.20534","doi":"10.1145/3448609","metadata_source":"pith","pith_arxiv_id":"2507.20534","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Kimi K2: Open Agentic Intelligence","venue":"cs.LG","work_id":"7f18284c-12d3-4137-bea1-1da97e8cf3c1","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2507.20534","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:2efaf01fe8e7eb5df87351ad25831b462d085c5529a8ea86058a54c5786c12ea","observation_id":"edf97d48-c9e6-4e65-96bd-054d5608cb57","resolution":{"observed_at":"2026-06-29T19:23:54.146230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T01:23:16.170083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.01322","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:37:49.308056Z","title":"Longcat-flash technical report","venue":null,"work_id":"112bbed5-cf36-4773-82b3-0229bfea4626","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:8b81655bd8e0f8c52e021d03473f22061b27abcd4f7fe07c8d647ab43dab60a9","observation_id":"0ee95c69-15bd-41b3-935a-d1151e2883d0","resolution":{"observed_at":"2026-06-29T19:23:54.139822Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:12a0d094c54e6facfbc442ae2c0f87ebec407f805638ef7c841949a1d6cc354f","observation_id":"89892269-ac0a-48a1-b24a-beba459b19a6","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:fd5e7142f4c9034ade5798a9089190f292046e34d7ddc25d759a794189772332","observation_id":"bf472e54-5e2f-4ac4-a943-fe57a12a42b4","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14655","last_updated":"2025-04-20T15:28:16Z","snapshot_observed_at":"2026-07-06T21:12:12.799570Z","submitted_at":"2025-04-20T15:28:16Z","title":"LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs","version":1},"cited_work":{"arxiv_id":"2504.14655","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14655","snapshot_observed_at":"2026-07-04T18:30:01.590053Z","title":"Leetcodedataset: A temporal dataset for robust evaluation and efficient training of code llms","venue":null,"work_id":"fa4f9b7e-a077-4016-9e1e-920df8d601b6","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2504.14655","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:79e02271f4bdc13f735886c991ac85c1f3531b01764431a5cf09f007d726cd75","observation_id":"bce36ece-1f7a-429c-a34c-0f0f7f459a10","resolution":{"observed_at":"2026-06-29T19:23:54.151382Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:fce79550430ce0f8182beaa9895cd61219d7ccd9eb968a1a5b90b368568dd56f","observation_id":"96821acc-4e76-4138-b9ec-90d845a510be","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":"2505.09388","doi":"10.1016/j.aiopen.2022.12","metadata_source":"pith","pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Qwen3 Technical Report","venue":"cs.CL","work_id":"25a4e30c-1232-48e7-9925-02fa12ba7c9e","year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:f06255335ba9fa7e8774371ba591026930855b25d228a71860bc214fe70bc931","observation_id":"28d62e9e-9bcd-46ce-9f35-d459cc42a612","resolution":{"observed_at":"2026-06-29T19:23:54.165445Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.03888","last_updated":"2017-09-13T23:25:07Z","snapshot_observed_at":"2026-07-06T05:55:05.946111Z","submitted_at":"2017-08-13T11:01:57Z","title":"Large Batch Training of Convolutional Networks","version":3},"cited_work":{"arxiv_id":"1708.03888","doi":"10.48550/arxiv.1708.03888","metadata_source":"pith","pith_arxiv_id":"1708.03888","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Training of Convolutional Networks","venue":"cs.CV","work_id":"92799584-c1e5-4828-bbfe-0771b7fe8706","year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1708.03888","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:7920599a60e670acf0f7709b0f2291bd9acd6133df45ab9fe51bd069c5ae5c3d","observation_id":"02230bd6-51b6-4260-8d26-e487bbd9f6c0","resolution":{"observed_at":"2026-06-29T19:23:54.190890Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":"1904.00962","doi":"10.48550/arxiv.1904.00962","metadata_source":"pith","pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":"cs.LG","work_id":"206d2a89-691e-4467-8958-5630dacf4765","year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:46c752db6b9f41b8df145d97f2424a7e78829a946f70e50adf22ba4523f430c7","observation_id":"9ae19538-8799-42cb-9fa4-dff37e696011","resolution":{"observed_at":"2026-06-29T19:23:54.196530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:384b8ade4c9cf73110ec7e1a75f5ffc5f3b2f1f55baf293af4a7cf79ee5833ff","observation_id":"0ea89bf3-a89d-4e80-bfcf-1c07df4ac269","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:0dba52935fe6ce5e807ef4f58714b661f8b3273c3f1de131041958f6e753c99a","observation_id":"46dbdc00-25b4-4e9f-9cdf-cf7f80150489","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:96c819f41fc17b2e0957a9c843f4d1845e6f19254a952987b400db16bf6778db","observation_id":"c1a348d7-382b-4b9f-bfea-5cf8b7a09258","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:1c3a62e8ab83e9167a70958cc7268e7d354cb793fa77944a952aec7a05cd9146","observation_id":"b0b04a74-c118-46eb-98f5-5d2d8fe980f3","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:ceb4ae7dbcc21d535a48993cf6ae29feab19858e10df664773d2f072aed7f393","observation_id":"3829172b-ce33-439c-a271-624c7cb8f29d","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T19:15:49.229099Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:848bface2144ebcd915119e565aa51d5bdbf702fc2db88d403a06a4404c01220","observation_id":"b823aabe-9f80-44c5-8356-b421fd9111f1","resolution":{"observed_at":"2026-06-29T19:15:49.229099Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":32,"verified_fuzzy":0},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2605.26842."}