Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-16T12:37:04.085148Z
Paper Citation Record · LEDGER
As of 20 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2504.12526.
A citation records a reference. It does not transfer a finding from one paper to another.
Typed states for the displayed outbound observations.
Source: paper_references, paper_reference_links, observed 2026-08-16T12:37:04.085148Z
One-hop event checks from named stored sources.
Source: scholarly_work_events, retraction_status_cache, observed 2026-08-20T06:33:59.587034+00:00
Pith citing papers itemized under the disclosed page cap.
Source: paper_references, paper_reference_links
A source-named dated measurement, never combined with another source.
Source: cited_works
27 of 27 outbound references displayed
External citation measurements
No source-named external measurement is stored.
Observation b70a65be-caa0-4bb3-b59c-291bb1c85459 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints
Reference 3
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fa6949e7-5842-4636-ac8f-41535f3bb3de · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Qwen Technical Report
Reference 4
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 31f4d700-c7d4-4df3-ad0c-bec071bdc39a · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Longformer: The Long-Document Transformer
Reference 5
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 8681f33d-23d5-41f8-bbef-d8f61945dffc · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Language models are few-shot learners
Reference 7
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d79c5867-c0c3-46bd-a45f-303d2b5cc021 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Training Deep Nets with Sublinear Memory Cost
Reference 8
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 30c09d60-b4cd-4590-b376-b88b837cebdf · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Gaussian Error Linear Units (GELUs)
Reference 11
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 937d8f17-05b4-4a40-bb8b-89c176168bc0 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Mistral 7B
Reference 13
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 1f4ddbd4-941d-45d2-9e05-cdd1e23d34f1 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Reformer: The Efficient Transformer
Reference 14
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 5edd78aa-6606-4dbe-b703-8c4264f82efe · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Efficient Memory Management for Large Language Model Serving with PagedAttention
Reference 15
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 791d11af-e209-41c9-ab6f-5e3dd20a6002 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Unresolved cited work
Reference 17
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation cc669be0-b05f-4031-9f2a-697391eca331 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Searching for Activation Functions
Reference 20
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ef5976cd-401f-429c-bfe3-41c2a001659b · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Morgane Riviere, Shreya Pathak, Pier Giuseppe Sessa, Cassidy Hardin, Surya Bhupatiraju, L´eonard Hussenot, Thomas Mesnard, Bobak Shahriari, Alexandre Ram´e, Johan Ferret, et al
Reference 21
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 506542d0-83bf-4bd0-ade7-dd566ec2f791 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Fast Transformer Decoding: One Write-Head is All You Need
Reference 22
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation b44b3e81-c2b0-4f14-92fc-06759c5f9257 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism
Reference 24
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 27aacc16-2829-4e1e-add6-8492ae44fff9 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters
Reference 25
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation a2d4a028-50d7-462e-80ca-527980c6313a · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Long Range Arena: A Benchmark for Efficient Transformers
Reference 26
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation d5e8d15e-c0ae-4b61-ab3b-2860aed233cd · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Llama 2: Open Foundation and Fine-Tuned Chat Models
Reference 27
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ba2c33e5-8ccb-482f-acaa-be2949a91614 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Large Batch Optimization for Deep Learning: Training BERT in 76 minutes
Reference 29
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation ae10ed15-d64d-4be1-a0c2-6458c89b49d0 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models memory trade-off and comparing them with other optimization methods
Reference 30
Source-reported events for the cited work
No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.
Observation ca4520ef-3c55-4e33-a5a8-b43c43f49046 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning
Reference 2016
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 2f060934-ee4f-4f57-961a-63c084e61d25 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Linformer: Self-Attention with Linear Complexity
Reference 2017
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 28264a83-f247-4924-bce6-06ced3814f1f · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models GLU Variants Improve Transformer
Reference 2019
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation fd908b79-eb89-499d-a733-b4dd6ed87520 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Forest-of-Thought: Scaling Test-Time Compute for Enhancing LLM Reasoning
Reference 2020
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 778f4d91-b6fd-4c0a-8ccd-82a4b4287482 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models Self-attention Does Not Need $O(n^2)$ Memory
Reference 2021
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation dcd9a9c8-1f30-4078-8947-a73970720cf9 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models The Llama 3 Herd of Models
Reference 2022
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 18839c6e-1293-4833-a060-f1e522083534 · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills
Reference 2023
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
Observation 6443fef6-db0f-4bf6-bb6f-ff150fa05b4e · outbound
MOM: Memory-Efficient Offloaded Mini-Sequence Inference for Long Context Language Models HeadInfer: Memory-Efficient LLM Inference by Head-wise Offloading
Reference 2025
Source-reported events for the cited work
Unavailable: canonical work link unavailable.
No inbound Pith citation observations are available.