Pith. sign in

Paper Citation Record · LEDGER

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training

As of 5 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 0 inbound Pith citation observations for arXiv:2605.26842.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2605.26842 v1

Coverage vector

measured 60 of 60 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-06-29T19:15:49.229099Z

measured 60 of 60 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-05T06:32:48.257954+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

60 of 60 outbound references displayed

  • verified exact32
  • verified fuzzy0
  • unresolved28
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation b22e087e-ecab-4463-afc2-c2827e173236 · outbound

This paper cites Dion: Distributed Orthonormalized Updates.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Dion: Distributed Orthonormalized Updates

Reference 1

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.125287Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:ee7cea28b11b667277a58302fc4584792e366a5f54b62e65ff7ff9ea7504b727

Observation 1dbdf28d-a2cf-4b39-84ba-34d5fe2097de · outbound

This paper cites Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Big-Math: A Large-Scale, High-Quality Math Dataset for Reinforcement Learning in Language Models

Reference 2

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.125590Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:d04e0396fc026fba3919d41124c0c93e89ca865f6a9c0ea1ae9c2fd09baefd17

Observation 077d95c3-c457-49f0-97ba-b90c1c404c0f · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 3

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:1199a81e0130b392d361d4812bee076bb4362c152d54a7a936a24bdb78d5314e

Observation 2a95a81f-c675-4e77-85ce-ec12b2e03368 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 4

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:f8c4fd9da550891bd2205aa466dc2e6559df5cfb7e61591b5518e9e98401a89a

Observation ee3bbbf6-c9af-4056-b3e4-aba4157ffb61 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 5

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:68f573e83ff3cde771f2933b2dcfca72c9e4db80370efc908490c301d9b0d71b

Observation 32feb5ce-7ebc-45a8-9254-9b3bb704d926 · outbound

This paper cites Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Shortcut-connected Expert Parallelism for Accelerating Mixture-of-Experts

Reference 6

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.130290Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:dc08037e3cb8f393c2f0c7fef100c119c9a09239a930126cefb059af6e000d87

Observation 090c46dc-5e5f-4efd-bf25-0dc56501c3f1 · outbound

This paper cites MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training MultiPL-E: A Scalable and Extensible Approach to Benchmarking Neural Code Generation

Reference 7

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.143475Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:f6d7699f2d009c5d461394861ee752fe44e4c75e2f319a4998ca9d533d6928ef

Observation 84a148f3-8882-49d5-8536-267aa31d2c86 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 8

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:a299b6b0934d05d53d971a984eb003838f30f66f12ca854dfcddd5ae4d834101

Observation 7bb56558-e906-442b-a332-b3fcc8b46601 · outbound

This paper cites FullStack Bench: Evaluating LLMs as Full Stack Coders.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training FullStack Bench: Evaluating LLMs as Full Stack Coders

Reference 9

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.161758Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:03240d7a3a0bccebeb1cbb5233723c2c415c27f8881190c84c50e7cf50ffcd6d

Observation 3345df67-ae38-4c38-be6a-81e5232a55a1 · outbound

This paper cites Training Verifiers to Solve Math Word Problems.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Training Verifiers to Solve Math Word Problems

Reference 10

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.206671Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:5e9f654eba45d2c3478474f65de8409c6dfb1b5e2ea67af56535734fb371c9e3

Observation 1b8d3fbe-4b69-4449-ac97-f4f2e940ef4e · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 11

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:449ab5112f0861a0d72bb043364fb4d84460dc8cc9fc33983cb5a82f7cd82de3

Observation 10046867-b00a-4aed-9eff-95ad6be94932 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 12

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:fd0c4b6042c24c742d44fe01119d5dcad4b23a303e507460d841a59ff716ddd1

Observation 84de64fe-e08e-404f-9b28-2646f9494065 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 13

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.201938Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:a349c715fe4db30a20ed63339752ab368a79d44a62acc3a7a4b35ed08d1fd4dc

Observation d311843c-b43e-439c-8c9b-2a596e4838e4 · outbound

This paper cites CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution

Reference 14

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.188044Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:7f1052686921627e8e2793c250060952c39e486ec8862d376fef9d31681fe7e0

Observation 943daeb0-ddb2-461f-9e83-c737307667f7 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 15

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:55becd81df5ce593bd6595e02986c17c14732ddcd9e9f7944fc728fef7e7619b

Observation 3f161f65-db91-4c9d-882b-59821c96be49 · outbound

This paper cites arXiv preprint arXiv:2511.20626 , year=.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training arXiv preprint arXiv:2511.20626 , year=

Reference 16

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.188574Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:d33ef4c70d0ae90030e4a228408e388cb28739dc32b8423e2fdc7036055cb0cb

Observation b2dd5281-b407-41f5-8a5e-cc2e1973d8ce · outbound

This paper cites Measuring Massive Multitask Language Understanding.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Measuring Massive Multitask Language Understanding

Reference 17

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.192731Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:b343e8690c493255190c7007ab11fe84171fe692ac5e25b19cd28319eb9f46c0

Observation d681cac6-2b9a-496f-8398-342f540c2b07 · outbound

This paper cites Measuring Mathematical Problem Solving With the MATH Dataset.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Measuring Mathematical Problem Solving With the MATH Dataset

Reference 18

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.176488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:56e2d8a763b82dc18554f70fdf090fe8b4a29b072667b3720526f19dbdc0a1f2

Observation ee370763-3f96-4e8e-bcf2-3f2597c650fb · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 19

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:f2a4917c1327cc7c7ae1a87765dc34f5b06da99cac925155ad1941223ff55257

Observation eb2f8f53-e214-4a2d-b19e-353102c86eb4 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 20

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:ca908d9017d0b11c66914f7c3c78c4fbd2341e3e1931f7f0076baab925bdfda2

Observation dc78544b-c3e2-4a04-8b94-f09856c4c3fc · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 21

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:ed4683ada81225a9293c6153e2abc3a1f8f1f41e98d796f9ecaeb774a2c080b9

Observation 76d85295-f68d-482f-85c9-ed643ddf275d · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 22

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:5559bfe334c3f5a196ec87be343c3afd57480d44d94077b68f9b9ee1be2cc5b7

Observation 54fef792-22cc-45ca-9e3c-a6fbe7536ce6 · outbound

This paper cites On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training On Large-Batch Training for Deep Learning: Generalization Gap and Sharp Minima

Reference 23

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.180575Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:594da126fa99d77329bbcafc2ac472036bf704076fcabde2d7348a683aa6560e

Observation 7e9a34c3-a52c-4a5c-9bed-2bcde22dd4c9 · outbound

This paper cites arXiv preprint arXiv:2510.16981 , year=.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training arXiv preprint arXiv:2510.16981 , year=

Reference 24

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:53.292274Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:dd72f431fa67bcdabd4196c33043a566904ca3599de3715b6db925bccfba1c15

Observation df06e14b-dcaa-4a21-8a8c-f554708710c0 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Adam: A Method for Stochastic Optimization

Reference 25

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.168862Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:cc87fdf6534d0d09ac4b758c259786e5fddf8f75da4187579a9a7069694a31cc

Observation 086a5296-6a0e-41b1-bdef-472c626c33a6 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 26

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:b1bf6b99c35ecb07665288c75daa41719e2628a6305e9208ca4741dc4752350e

Observation fab01d20-92bf-4664-9b3c-46151b30de33 · outbound

This paper cites CMMLU: Measuring massive multitask language understanding in Chinese.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training CMMLU: Measuring massive multitask language understanding in Chinese

Reference 27

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.171237Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:31b2bae4eaaaf6489b4c9e45d1cb33e1c3e948252d7f47833861875754d71e16

Observation 217aa053-0051-44b5-8678-0ef536251222 · outbound

This paper cites DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model

Reference 29

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.204328Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:8ea6480c898af60588cbdaad5e021adbb8bc04974b9084879f2f954182a61483

Observation 8e924ddf-5bde-41ea-a53d-596c3440faf0 · outbound

This paper cites DeepSeek-V3 Technical Report.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training DeepSeek-V3 Technical Report

Reference 30

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.177491Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:518ff75e84c01c412aee04accb5ee71d06ca8e5b8cb37bbca39988e3d90b4396

Observation 79e5b7f4-5747-43d2-8186-313bd40e6c04 · outbound

This paper cites & Cai, X.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training & Cai, X

Reference 31

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.190449Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:4addcddca4a4c21e14ba532c57ae7ab2dbaa46796a86f117cdc1c0d102712181

Observation feef782f-0f2e-428a-a4d7-bdc7c26cb5be · outbound

This paper cites Evaluating Language Models for Efficient Code Generation.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Evaluating Language Models for Efficient Code Generation

Reference 32

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.195640Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:35c9af00c23fbb718bbfb248f2d5c3f80d06652e9c50eb54191a29a2d606109d

Observation 608c9a27-86ac-4a3e-9316-dac840a4281c · outbound

This paper cites Muon is Scalable for LLM Training.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Muon is Scalable for LLM Training

Reference 33

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.198683Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:efdf925bdb61dcb8eb752a2eb7eb8809266841c1e6d5a1815e1e31e2f5d360d7

Observation 4a37dacf-26de-4453-9d38-825bba520922 · outbound

This paper cites Decoupled Weight Decay Regularization.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Decoupled Weight Decay Regularization

Reference 34

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.208965Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:48ac2394507a275389d37556dd60230f62490583cd91470ffbb3a435e974c088

Observation 9eafd766-6496-4d86-b655-d7fbf9a6b739 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 35

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:3afcdb0f9fc5092bca48bedc89e9a596c5495aecba82d1d530e6d6c5789fae14

Observation 5964b405-6ec4-453a-afaa-23cbf3bdea7a · outbound

This paper cites Mixed Precision Training.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Mixed Precision Training

Reference 36

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.146743Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:8b1534574fc33ab5c9b75f655302846de35a8c42289f8513d7e1f04a58c17013

Observation 413e8111-3bad-4183-9527-f44d49a6cfac · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 37

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:3cfd8697243578e1cf5f2f4e2eadba146da0e1f765cee5502c18a5ac2ff495db

Observation 40f403e9-74c7-482e-80a4-595ee2f3bb8b · outbound

This paper cites GPQA: A Graduate-Level Google-Proof Q&A Benchmark.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training GPQA: A Graduate-Level Google-Proof Q&A Benchmark

Reference 38

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.153752Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:d88cf8e6dfbc72e4940ed28143761858173a3c55b3f110edc4835cc872797a15

Observation 1f0a1af9-c824-4388-8d9c-876cc8fed84e · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 39

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:6321dfa769dc49a2f35b0359144079b7524bac36c0d391426de46fa1340063f1

Observation a2015213-337a-4bfc-bb6f-399e4a85d2fa · outbound

This paper cites WinoGrande: An Adversarial Winograd Schema Challenge at Scale.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training WinoGrande: An Adversarial Winograd Schema Challenge at Scale

Reference 40

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.156148Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:f8e0047961ab3c6b9d5c906c3793daf6750bcc05757f83be80a49e594d50a057

Observation ca23e014-9892-4880-86a7-a9c669707b9c · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 41

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:524df8d4b1840e5f3ac1de3ebca4850d5b08dbe2e7394b396f398941875fbf98

Observation be02a92c-11a8-416e-b80c-a2011b1a6449 · outbound

This paper cites Adamuon: Adaptive muon optimizer.arXiv preprint arXiv:2507.11005.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Adamuon: Adaptive muon optimizer.arXiv preprint arXiv:2507.11005

Reference 42

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.159088Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:46a9df2560a15708e7fe0462ccdb03370df37e780c31a3128cb51b4e6ad65c1e

Observation fa038fce-780c-4123-b676-f50b183f6330 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 43

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:30bea8945ad45e6b9dc4501f3341ed58c16ec64fbdcc1bcafe62081361dce6a6

Observation d7eafdea-592c-4ef8-969e-ef01ee2cd41a · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 44

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:5c157e3f08768a93ca317762b7aedeccbdf100e76c722c89b67249e9af1733c5

Observation 1d7fd369-0426-443c-947b-0ed058e9b073 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 45

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:06f883980ceaa48567f73c6bfd6aba17548f2972967bfebe60028ae951da7b9a

Observation a46f17e8-76d9-4d07-8144-51ab48920d53 · outbound

This paper cites doi: 10.18653/v1/n19-1421.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training doi: 10.18653/v1/n19-1421

Reference 46

Resolution
verified exact
doi, observed 2026-06-29T19:23:53.289710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:95b7124079320761417794b26d07ac9876c264d4d77a4507759462f64c76c554

Observation edf97d48-c9e6-4e65-96bd-054d5608cb57 · outbound

This paper cites Kimi K2: Open Agentic Intelligence.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Kimi K2: Open Agentic Intelligence

Reference 47

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.146230Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:2efaf01fe8e7eb5df87351ad25831b462d085c5529a8ea86058a54c5786c12ea

Observation 0ee95c69-15bd-41b3-935a-d1151e2883d0 · outbound

This paper cites Longcat-flash technical report.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Longcat-flash technical report

Reference 48

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.139822Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:8b81655bd8e0f8c52e021d03473f22061b27abcd4f7fe07c8d647ab43dab60a9

Observation 89892269-ac0a-48a1-b24a-beba459b19a6 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 49

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:12a0d094c54e6facfbc442ae2c0f87ebec407f805638ef7c841949a1d6cc354f

Observation bf472e54-5e2f-4ac4-a943-fe57a12a42b4 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 50

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:fd5e7142f4c9034ade5798a9089190f292046e34d7ddc25d759a794189772332

Observation bce36ece-1f7a-429c-a34c-0f0f7f459a10 · outbound

This paper cites LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training LeetCodeDataset: A Temporal Dataset for Robust Evaluation and Efficient Training of Code LLMs

Reference 51

Resolution
verified exact
arxiv_id, observed 2026-06-29T19:23:54.151382Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:79e02271f4bdc13f735886c991ac85c1f3531b01764431a5cf09f007d726cd75

Observation 96821acc-4e76-4138-b9ec-90d845a510be · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 52

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:fce79550430ce0f8182beaa9895cd61219d7ccd9eb968a1a5b90b368568dd56f

Observation 28d62e9e-9bcd-46ce-9f35-d459cc42a612 · outbound

This paper cites Qwen3 Technical Report.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Qwen3 Technical Report

Reference 53

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.165445Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:f06255335ba9fa7e8774371ba591026930855b25d228a71860bc214fe70bc931

Observation 02230bd6-51b6-4260-8d26-e487bbd9f6c0 · outbound

This paper cites Large Batch Training of Convolutional Networks.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Large Batch Training of Convolutional Networks

Reference 54

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.190890Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:7920599a60e670acf0f7709b0f2291bd9acd6133df45ab9fe51bd069c5ae5c3d

Observation 9ae19538-8799-42cb-9fa4-dff37e696011 · outbound

This paper cites Large Batch Optimization for Deep Learning: Training BERT in 76 minutes.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Large Batch Optimization for Deep Learning: Training BERT in 76 minutes

Reference 55

Resolution
verified exact
local_arxiv, observed 2026-06-29T19:23:54.196530Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:46c752db6b9f41b8df145d97f2424a7e78829a946f70e50adf22ba4523f430c7

Observation 0ea89bf3-a89d-4e80-bfcf-1c07df4ac269 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 56

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:384b8ade4c9cf73110ec7e1a75f5ffc5f3b2f1f55baf293af4a7cf79ee5833ff

Observation 46dbdc00-25b4-4e9f-9cdf-cf7f80150489 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 57

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:0dba52935fe6ce5e807ef4f58714b661f8b3273c3f1de131041958f6e753c99a

Observation c1a348d7-382b-4b9f-bfea-5cf8b7a09258 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 58

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:96c819f41fc17b2e0957a9c843f4d1845e6f19254a952987b400db16bf6778db

Observation b0b04a74-c118-46eb-98f5-5d2d8fe980f3 · outbound

This paper cites an unresolved cited work.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training Unresolved cited work

Reference 59

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:1c3a62e8ab83e9167a70958cc7268e7d354cb793fa77944a952aec7a05cd9146

Observation 3829172b-ce33-439c-a271-624c7cb8f29d · outbound

This paper cites online" 'onlinestring :=.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training online" 'onlinestring :=

Reference 60

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:ceb4ae7dbcc21d535a48993cf6ae29feab19858e10df664773d2f072aed7f393

Observation b823aabe-9f80-44c5-8356-b421fd9111f1 · outbound

This paper cites write newline.

MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training write newline

Reference 61

Resolution
unresolved
no resolver link, observed 2026-06-29T19:15:49.229099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-06-29T19:15:49.229099Z digest=sha256:848bface2144ebcd915119e565aa51d5bdbf702fc2db88d403a06a4404c01220

Pith citing papers

No inbound Pith citation observations are available.