Pith. sign in

Paper Citation Record · LEDGER

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training

As of 17 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2508.20577.

A citation records a reference. It does not transfer a finding from one paper to another.

pith.paper-citation-record.v1
2508.20577 v1

Coverage vector

measured 39 of 39 reference resolution

Typed states for the displayed outbound observations.

Source: paper_references, paper_reference_links, observed 2026-08-15T16:47:40.978144Z

measured 39 of 39 standing notices

One-hop event checks from named stored sources.

Source: scholarly_work_events, retraction_status_cache, observed 2026-08-17T06:30:58.91139+00:00

measured 0 of 0 inbound itemization

Pith citing papers itemized under the disclosed page cap.

Source: paper_references, paper_reference_links

measured 0 of 1 external citation measurements

A source-named dated measurement, never combined with another source.

Source: cited_works

Reference resolution

39 of 39 outbound references displayed

  • verified exact1
  • verified fuzzy4
  • unresolved34
  • parse uncertain0
  • malformed identifier0
  • metadata mismatch0

External citation measurements

No source-named external measurement is stored.

Outbound references

Observation 00536eda-e873-4e3c-8b51-e1bf92886003 · outbound

This paper cites PaLM 2 Technical Report.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training PaLM 2 Technical Report

Reference 1

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.821282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.821282Z digest=sha256:187eb6f7d6c8d7f992428a6dad5421f61b1f5caf726666db272bc41afae8b323

Observation 48cc2c03-4762-4358-a072-c741a91422d2 · outbound

This paper cites Layer Normalization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Layer Normalization

Reference 2

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.826199Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.826199Z digest=sha256:e86a50e0ce41d3a08b644782596419f64cb9813f6d166418bd6fbd9ee5967ac5

Observation 868a89ea-3a3c-447f-bf09-c74aca95be43 · outbound

This paper cites signSGD: Compressed Optimisation for Non-Convex Problems.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training signSGD: Compressed Optimisation for Non-Convex Problems

Reference 3

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.830803Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.830803Z digest=sha256:042bf2f1d7fffab537f40274027055e303ec966faccf2c495cfb35376e0dcf9d

Observation 1d258652-2810-44e7-9183-08469a9a469f · outbound

This paper cites Language Models are Few-Shot Learners.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Language Models are Few-Shot Learners

Reference 4

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.835099Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.835099Z digest=sha256:f58fea620f93c70d478399bbf4959f777156c28bb8348050d4c903d4c89bac3a

Observation d29b5c88-3938-489b-94ff-034d6f5dc85c · outbound

This paper cites Symbolic Discovery of Optimization Algorithms.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Symbolic Discovery of Optimization Algorithms

Reference 5

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.839244Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.839244Z digest=sha256:1aac265e0b8c8d31bb8a47f0374d7775bd4928b9b0060fd82450a13fe2d52ccf

Observation 7cc3a860-ff08-41c3-addd-cbe10f223769 · outbound

This paper cites PaLM: Scaling Language Modeling with Pathways.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training PaLM: Scaling Language Modeling with Pathways

Reference 6

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.843641Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.843641Z digest=sha256:c0121b8ba50725ad662eaf1d19ac385aafc398068abdedfd441b13de677abfa5

Observation 0d2fa216-177b-43ee-834e-28c723dc2faf · outbound

This paper cites an unresolved cited work.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Unresolved cited work

Reference 7

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:47:41.399334Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.847984Z digest=sha256:a5512919db09e2c6cc2fdf5da4d5ed8a492dedbbcc171ecd233d561bf004e989

Observation 9f732d36-d317-4f1d-a4f7-a79b481b3d39 · outbound

This paper cites An image is worth 16x16 words: Transformers for image recognition at scale.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training An image is worth 16x16 words: Transformers for image recognition at scale

Reference 8

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.852042Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.852042Z digest=sha256:0fe06d76f1b0ef5723d305c9c53226bad91e5e0b7a10756323fd33155bfacd19

Observation dfb0457d-1485-439f-b709-6c19696956d8 · outbound

This paper cites The Llama 3 Herd of Models.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training The Llama 3 Herd of Models

Reference 9

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.855965Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.855965Z digest=sha256:cc5c7b4aca5bd4ffc3215e98be121c63635ea19c3d254f66b5e5ac30e7dd6f99

Observation 25e7437a-44e6-420d-9b14-135720a38361 · outbound

This paper cites Sharpness-aware minimization for efficiently improving generalization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Sharpness-aware minimization for efficiently improving generalization

Reference 10

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.860528Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.860528Z digest=sha256:addec7d925d5012a2515e729adf31f69a01544eec9657a3352696f68ce2fde67

Observation 4a6f2685-e159-4453-b010-d93bc834efcd · outbound

This paper cites and Cohen, V.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training and Cohen, V

Reference 11

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.865458Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.865458Z digest=sha256:97602bbcdb58982c079d4a30e1f5cfd0c697d0068abbbdb7900387bec1c91285

Observation 1295bc0e-e343-4323-a6a3-02a49e75edfd · outbound

This paper cites Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour

Reference 12

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.869589Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.869589Z digest=sha256:9370ad1c477345a9b3eed6fa28e6db9265f03219a70c95fba64b0ad1421d6d58

Observation b884f949-757c-48c7-a1d9-5e709626fd48 · outbound

This paper cites A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Vinyals, O., Rae, J.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training A., Welbl, J., Clark, A., Hennigan, T., Noland, E., Millican, K., van den Driessche, G., Damoc, B., Guy, A., Osindero, S., Simonyan, K., Elsen, E., Vinyals, O., Rae, J

Reference 13

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:47:41.369848Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.873768Z digest=sha256:e15a0ed5f97cfd3702ebcccf55a46d38621d0e21a56588d83c6196afbaca6fd3

Observation 86f03f8f-1343-40cf-80de-eb6c9172dc4a · outbound

This paper cites Scaling Laws for Neural Language Models.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Scaling Laws for Neural Language Models

Reference 14

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.877523Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.877523Z digest=sha256:736042ec8eaf1888c4f81099fbf17b7010aec610fcc1b5e16719c8dac688e6b7

Observation cb8f79de-a0f2-4949-a894-29dea75f3f7e · outbound

This paper cites S., Mudigere, D., Nocedal, J., Smelyanskiy, M., and Tang, P.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training S., Mudigere, D., Nocedal, J., Smelyanskiy, M., and Tang, P

Reference 15

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.881521Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.881521Z digest=sha256:f527c32559a86a8281956c446c7669419630573c240e3a1ada2b4fe374b89651

Observation 510cb7d9-b7d9-41f1-894a-5010e5426634 · outbound

This paper cites Adam: A Method for Stochastic Optimization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Adam: A Method for Stochastic Optimization

Reference 16

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.885254Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.885254Z digest=sha256:8a24bb0bf77a5df6d6a139bb8ff95ae6256f13982c8d45e43b7278ba9ce7042a

Observation b89311ea-5430-4b71-bbd0-3fbc8be8f149 · outbound

This paper cites BERT busters: Outlier dimensions that disrupt transformers.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training BERT busters: Outlier dimensions that disrupt transformers

Reference 17

Resolution
verified exact
doi, observed 2026-08-15T16:47:41.034630Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.888858Z digest=sha256:abc4668012c3d2c713d4716477dc8b0b2e7144f80dd4a1905a0896c7acabdb2e

Observation 9f59a17c-bb5c-4b79-9ca9-a0323af91dab · outbound

This paper cites an unresolved cited work.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Unresolved cited work

Reference 18

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:47:41.353406Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.892720Z digest=sha256:771d488a9b5b96923aada9ceb28c882f5591f44810a4650ea0adb6d75628e9dc

Observation b07209ad-15d7-437a-bcd2-8032acda675b · outbound

This paper cites Towards Efficient and Scalable Sharpness-Aware Minimization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Towards Efficient and Scalable Sharpness-Aware Minimization

Reference 19

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.896713Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.896713Z digest=sha256:ce335b1a97eec61f41e4240dd9d31f4b6fbfbc295bee6462cb03b7e5eeae79c3

Observation 392d5957-3675-40b9-a941-3360fe2c57b3 · outbound

This paper cites Decoupled Weight Decay Regularization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Decoupled Weight Decay Regularization

Reference 20

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.904282Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.904282Z digest=sha256:1f855e5cb1b1232653d5366512b8aff21b321b33a61f1db94eb7f627d7b9fd55

Observation 4f22d135-dcb0-4361-9708-7cd5305d35f1 · outbound

This paper cites Came: Confidence-guided adaptive memory efficient optimization.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Came: Confidence-guided adaptive memory efficient optimization

Reference 21

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:47:41.343360Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.908018Z digest=sha256:413396e48d7697c8368b6fd8cf4580bf1be40db946d87e8b9df750d571bf1eaf

Observation 8b5bcf96-9658-45a1-a857-6b667e081f93 · outbound

This paper cites Pointer sentinel mixture models.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Pointer sentinel mixture models

Reference 22

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.911793Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.911793Z digest=sha256:5db976f77c9a587ce795ce00b46db6b439b4fb005e2853427e0cbf9cdd5ccb99

Observation f7af4b4a-369b-4d7a-b103-41d95dd46cf6 · outbound

This paper cites an unresolved cited work.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Unresolved cited work

Reference 23

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:47:41.323248Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.915540Z digest=sha256:23127f50f2282c4091b5c77f01fb930792cf456cb29c57439b2e79485b31e9cc

Observation cac7ff3a-7045-4055-bf1c-5aebecbb9036 · outbound

This paper cites GPT-4 Technical Report.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training GPT-4 Technical Report

Reference 24

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.919052Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.919052Z digest=sha256:32b2eb42f27c28575befeab82ad5ac082c7bfa2b7f199612af0fba454572119b

Observation ff089083-a098-4ad3-a2ed-0f507802c65e · outbound

This paper cites Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern \'a ndez, R.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Q., Bernardi, R., Pezzelle, S., Baroni, M., Boleda, G., and Fern \'a ndez, R

Reference 25

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.922862Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.922862Z digest=sha256:0e44a863ea491e3345f545be9fdd9fb8855cb35c4088c5969d123abf09f60c19

Observation 418f4709-e72f-4744-96ea-cff99a3a1801 · outbound

This paper cites PyTorch: An Imperative Style, High-Performance Deep Learning Library.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training PyTorch: An Imperative Style, High-Performance Deep Learning Library

Reference 26

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.926684Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.926684Z digest=sha256:bee4500fb27999af96136bc286e857ccf7c04f7ce1188b4b258c1d9d4eaa7cc4

Observation 3bb0d58c-e7bc-47b9-ae69-4492e72cc47e · outbound

This paper cites Outlier dimensions that disrupt transformers are driven by frequency.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Outlier dimensions that disrupt transformers are driven by frequency

Reference 27

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.931126Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.931126Z digest=sha256:485eb1047c0889bf061f88165bebcf06eaa921897e5a4a52885062a82182e0a4

Observation 825c7a33-3ccb-4460-9340-6766baaca385 · outbound

This paper cites Language models are unsupervised multitask learners.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Language models are unsupervised multitask learners

Reference 28

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.935213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.935213Z digest=sha256:7dca903df057d00aa0b1ada8778f0e020c21965061bed2f82db8b3736055a222

Observation 68c836b4-97bb-4af0-8c20-ff25fd571f9d · outbound

This paper cites Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer

Reference 29

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.938783Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.938783Z digest=sha256:47ab09893886bd52d2919f1a7d1a77b1ea04b3324475f33c30418f46e646aff7

Observation a4ba05fa-53cd-4014-b12f-1dbfb01ac801 · outbound

This paper cites Measuring the Effects of Data Parallelism on Neural Network Training.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Measuring the Effects of Data Parallelism on Neural Network Training

Reference 30

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.942556Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.942556Z digest=sha256:bc96dd856bf3a3ee46124ae021f6ba2870ceef19063634581bfeb7295a535690

Observation c1638893-6607-4b7d-8f13-afcb2424a852 · outbound

This paper cites Dropout: a simple way to prevent neural networks from overfitting.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Dropout: a simple way to prevent neural networks from overfitting

Reference 31

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:47:41.301411Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.946488Z digest=sha256:047fedd41c8e81ef78d87651e9468d3b7dae3c233d4a795dd1773e846259211a

Observation 9799ce51-2588-4627-bfbe-83d5d0bfa779 · outbound

This paper cites LLaMA: Open and Efficient Foundation Language Models.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training LLaMA: Open and Efficient Foundation Language Models

Reference 32

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.950369Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.950369Z digest=sha256:01dedb2c15811289b6dd8a2442fb59df47e3aadf808591e6f9509afb69563d4a

Observation 2b13b801-1507-4023-9d38-259f4142874d · outbound

This paper cites N., Kaiser, L.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training N., Kaiser, L

Reference 33

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.954213Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.954213Z digest=sha256:56d7f84d6f1844dec87aa0233d035384466b6247e86f8b7165d1c0af832c8128

Observation 96a11328-e3bd-4340-a10e-fcf52a4e3de8 · outbound

This paper cites Superglue: A stickier benchmark for general-purpose language understanding systems.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Superglue: A stickier benchmark for general-purpose language understanding systems

Reference 34

Resolution
verified fuzzy
raw_fallback, observed 2026-08-15T16:47:41.282488Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.958007Z digest=sha256:4312cfad0e1bbba38acb46ea2c1d50a0af9a2f359546e427d68c7feed0776b04

Observation 0dbfa62a-575f-433d-b5ba-6ea175404b13 · outbound

This paper cites J., Xiao, L., Everett, K.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training J., Xiao, L., Everett, K

Reference 35

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.961712Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.961712Z digest=sha256:e5c5c1e0d9c1df8764134f5a38fa1dd3c1f6216d235e136a8dc2e20431ad7101

Observation 581456ae-21a9-451b-a5d7-a9e9e8f77c15 · outbound

This paper cites Large Batch Training of Convolutional Networks.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Large Batch Training of Convolutional Networks

Reference 36

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.965792Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.965792Z digest=sha256:3004f62b6f93fa8d87767d618fdd54fb2387c91a09dbd345106d29ca1b1ec77c

Observation 321a57a9-80d2-4797-a589-418251fd927e · outbound

This paper cites Large Batch Optimization for Deep Learning: Training BERT in 76 minutes.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Large Batch Optimization for Deep Learning: Training BERT in 76 minutes

Reference 37

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.969614Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.969614Z digest=sha256:14159dbac956aa02fcc8f83162a97a958c6d2711a3f5fc543d06dfb03a80becb

Observation 3fe49a30-ba22-4397-9c40-aa41c4b10581 · outbound

This paper cites an unresolved cited work.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training Unresolved cited work

Reference 38

Resolution
unresolved
raw_fallback, observed 2026-08-15T16:47:41.263710Z

Source-reported events for the cited work

No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.

source=arxiv_source observed=2026-08-15T16:47:40.973417Z digest=sha256:4e4f40447ca4b1d6d88d790a25dfa54fcb1c585ae385af5bb38cda2b42a8e144

Observation 9b8adbba-b92f-43b4-8efd-97975f0c37be · outbound

This paper cites write newline.

MERIT: Maximum-normalized Element-wise Ratio for Language Model Large-batch Training write newline

Reference 39

Resolution
unresolved
no resolver link, observed 2026-08-15T16:47:40.978144Z

Source-reported events for the cited work

Unavailable: canonical work link unavailable.

source=arxiv_source observed=2026-08-15T16:47:40.978144Z digest=sha256:515dc6bd27dceeac2a53a00dcd2a3fbba02de6c5cbf27b0976fa96f3824aaec9

Pith citing papers

No inbound Pith citation observations are available.