{"as_of":"2026-08-05T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:75b5163d6dd3501ded0568b89663759995325abdd6386be8e3c3a1a7d9f66656","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-16T06:26:38.569394Z","state":"measured"},{"denominator":127,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":127,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":59,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T14:43:02.535332Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":1,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2410.13846","last_updated":"2026-05-18T05:12:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-17T17:58:14Z","title":"LightTransfer: Your Long-Context LLM is Secretly a Hybrid Model with Effortless Adaptation","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T18:31:35.391674Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2410.13846"},"observation_digest":"sha256:48f13ddcae8dce7e38d01987cb78b078c4d7a0483314b216942a8119ff9b705e","observation_id":"3d1512fb-5401-4e5a-b585-ab8934f029a8","resolution":{"observed_at":"2026-05-23T18:33:19.550020Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2502.13189","last_updated":"2025-02-18T14:06:05Z","snapshot_observed_at":"2026-07-06T20:38:48.725605Z","submitted_at":"2025-02-18T14:06:05Z","title":"MoBA: Mixture of Block Attention for Long-Context LLMs","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-16T06:15:46.085555Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2502.13189"},"observation_digest":"sha256:4f2855667d1d9eb6d768a24b61443cc4113516bae517cf58bcc4607f855a7846","observation_id":"70cbb10f-d834-44e6-917c-872bc1fcfe16","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-23T02:25:04.405036Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2502.13923"},"observation_digest":"sha256:977ba813cccc9402792bc267f9a9b005938aea9057168e811309ab34fc8eaa0a","observation_id":"b9bd8dc2-3dfb-4e97-bcef-6e0678c4f6fa","resolution":{"observed_at":"2026-05-23T02:25:19.044130Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2505.06708","last_updated":"2025-05-10T17:15:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-10T17:15:49Z","title":"Gated Attention for Large Language Models: Non-linearity, Sparsity, and Attention-Sink-Free","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-12T09:04:34.807225Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2505.06708"},"observation_digest":"sha256:0916fb9c6a8e8411994ef0b3b76354ec2ab1492fa98c913dd28c940c9f320b52","observation_id":"a6cc82a0-b045-4130-9a71-655fe31388d5","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T09:28:16.189617Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2506.13585"},"observation_digest":"sha256:cfddee3d38ea0d9704fa4ae28648c8691593e2c37b21bb5f146343c74fe763d2","observation_id":"d4ef5545-0d5b-4647-9c1f-e04512a18721","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2507.02259","last_updated":"2026-07-29T12:55:39Z","snapshot_observed_at":"2026-08-01T23:32:07.108143Z","submitted_at":"2025-07-03T03:11:50Z","title":"MemAgent: Reshaping Long-Context LLM with Multi-Conv RL-based Memory Agent","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-15T11:17:24.406028Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2507.02259"},"observation_digest":"sha256:780bd451bc6b9a3c34970b71c4776c5bd5bdb7e295acd00f7f03ea641e667958","observation_id":"251c5e9b-7a2b-48e5-b9c3-1e728bd321ed","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2507.23386","last_updated":"2026-05-02T08:43:04Z","snapshot_observed_at":"2026-08-03T20:35:59.300261Z","submitted_at":"2025-07-31T10:01:11Z","title":"Causal2Vec: Improving Decoder-only LLMs as Embedding Models through a Contextual Token","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-19T02:19:20.792488Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2507.23386"},"observation_digest":"sha256:8aef582a83dff115a22c8350ef7331958ab50558ed01e1235b08da5eec083cdd","observation_id":"29d89a47-7d27-49bc-8d14-8a498d83b218","resolution":{"observed_at":"2026-05-19T02:21:59.265338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2509.21275","last_updated":"2026-04-25T07:48:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-25T15:01:25Z","title":"InfiniPipe: Elastic Pipeline Parallelism for Efficient Variable-Length Long-Context LLM Training","version":4},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-18T14:04:31.017142Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2509.21275"},"observation_digest":"sha256:6fb15be6e06581099ac084a11b9018fe39921dda3e5577af64f2fc24a788c857","observation_id":"6e8b9b0f-0fb6-4214-bccd-f7592a609d0f","resolution":{"observed_at":"2026-05-18T14:06:27.257150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2509.22630","last_updated":"2026-04-24T05:03:12Z","snapshot_observed_at":"2026-07-06T22:30:55.313733Z","submitted_at":"2025-09-26T17:55:22Z","title":"StateX: Enhancing RNN Recall via Post-training State Expansion","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T12:27:06.616920Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2509.22630"},"observation_digest":"sha256:85a8ce36056a9bd7a7fe18333002501b1efaedc86fcfac0408b5e57d85611580","observation_id":"c97209c8-b2a4-46f5-b362-09d302fc60b5","resolution":{"observed_at":"2026-05-18T12:31:22.112906Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-04T14:42:59.377440Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.23722","last_updated":"2026-07-03T02:44:15Z","snapshot_observed_at":"2026-08-04T14:42:54.705316Z","submitted_at":"2025-09-28T08:05:13Z","title":"OctoPipe: Reducing Pipeline Bubbles for Heterogeneous Models via Co-Optimizing Partitioning, Placement, and Scheduling","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T14:42:59.377440Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2509.23722"},"observation_digest":"sha256:a1322527d58b1aadc8b7cb56566e6611ad747d92af440a1fcec2bb60fc73357c","observation_id":"792e798f-6720-4832-9689-43d6818dabde","resolution":{"observed_at":"2026-08-04T14:42:59.377440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-04T14:43:02.535332Z","title":"Minimax-01: Scaling foundation models with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.02361","last_updated":"2026-05-25T07:51:15Z","snapshot_observed_at":"2026-08-04T14:42:55.586487Z","submitted_at":"2025-09-28T11:04:00Z","title":"ChunkLLM: A Lightweight Pluggable Framework for Accelerating LLMs Inference","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T14:43:02.535332Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2510.02361"},"observation_digest":"sha256:2af1d4214bf9c329cf5ef8487061a8d9f19d0990061eeea285e73b354fb4e420","observation_id":"bd1c0ab8-89ca-4471-956a-5a7afbdc86fa","resolution":{"observed_at":"2026-08-04T14:43:02.535332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2510.04595","last_updated":"2026-04-12T08:00:47Z","snapshot_observed_at":"2026-08-04T00:21:27.591930Z","submitted_at":"2025-10-06T08:49:04Z","title":"SpikingMamba: Towards Energy-Efficient Large Language Models via Knowledge Distillation from Mamba","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-18T09:44:53.290259Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2510.04595"},"observation_digest":"sha256:46a86ad8089f504c06bde8197c6394d01a02a410643c1fdde2a3b2cc75f6e568","observation_id":"1634359b-11f0-46c9-868c-92ac777ae4dc","resolution":{"observed_at":"2026-05-18T09:46:12.416706Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-02T20:03:37.497118Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:37c23e61e4cb74a248a13e26c2fa98a8eb739eb089123b8393618f22f9e92777","observation_id":"3d902561-7af7-45e5-b1b6-8875eda90177","resolution":{"observed_at":"2026-05-18T10:21:15.043518Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:99aecf1edcc796a45d5813a11825abf27cedd681b9016743e1004f912cdf4e9e","observation_id":"e911b3eb-3eb6-4c01-be23-aac7d558d4b8","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2511.21471","last_updated":"2026-05-07T07:59:46Z","snapshot_observed_at":"2026-08-02T23:27:20.204280Z","submitted_at":"2025-11-26T15:04:18Z","title":"SpatialBench: Benchmarking Multimodal Large Language Models for Spatial Cognition","version":4},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-17T04:54:59.903644Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2511.21471"},"observation_digest":"sha256:89f942d5aa22f181aa21cdd3c8a9d4469d0d11f89f40aced74a6538e8c09cbb6","observation_id":"305c7c14-d515-4b80-a7ee-fd3a08b5476b","resolution":{"observed_at":"2026-05-17T04:59:04.221022Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-03T04:55:42.327280Z","title":"org/abs/2501.08313","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-03T04:55:39.986463Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:42.327280Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:50cfbd7198a2eb481a31ee6a88452de7550e66f4fd277bbe7f555d1465109077","observation_id":"67bb743a-09cb-4541-adbc-23e5221ac94f","resolution":{"observed_at":"2026-08-03T04:55:42.327280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-13T16:19:49.419805Z","title":"MiniMax, Aonian Li, Bangwei Gong, Bo Yang, Boji Shan, Chang Liu, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.28457","last_updated":"2026-06-24T09:39:21Z","snapshot_observed_at":"2026-08-02T09:49:06.093893Z","submitted_at":"2026-03-30T13:59:38Z","title":"Three non-Hermitian random matrix universality classes of complex edge statistics: Spacing ratios and distributions","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-13T16:19:49.419805Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2603.28457"},"observation_digest":"sha256:b345b276470999efd22892fc50d4adedddd594c564beaf0ddad3ebed4de3dc2a","observation_id":"f5023faf-b806-43fe-b7d0-9e5e5da4f723","resolution":{"observed_at":"2026-07-13T16:19:49.419805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2603.28458","last_updated":"2026-04-06T09:47:34Z","snapshot_observed_at":"2026-08-02T11:27:36.874895Z","submitted_at":"2026-03-30T13:59:51Z","title":"HISA: Efficient Hierarchical Indexing for Fine-Grained Sparse Attention","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-14T21:40:28.854082Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2603.28458"},"observation_digest":"sha256:5e2b2e007844793382233f4c5c4031f4cabe7fda74cac7833713efdadf9d0faf","observation_id":"14ad3b12-c98d-48e9-86ed-b39ccc917e37","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.05942","last_updated":"2026-04-07T14:38:05Z","snapshot_observed_at":"2026-07-06T22:54:30.567988Z","submitted_at":"2026-04-07T14:38:05Z","title":"BOSCH: Black-Box Binary Optimization for Short-Context Attention-Head Selection in LLMs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T19:37:20.615497Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.05942"},"observation_digest":"sha256:4a0cf666dc977b2e3c7e765706f3f2a155cc91e815ecc9e799bcaa3993138039","observation_id":"cca06ad0-3628-40b8-8f66-a19ac566dc39","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.11790","last_updated":"2026-05-11T16:09:04Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:55:11Z","title":"ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-10T16:05:47.517157Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.11790"},"observation_digest":"sha256:3f7750b07e066773ea87cbee139cf3aefd949ce3b25706306bdc44890af47b95","observation_id":"76c10caf-d8e9-4243-a208-288a16825518","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.11790","last_updated":"2026-05-11T16:09:04Z","snapshot_observed_at":"2026-07-06T23:00:08.171601Z","submitted_at":"2026-04-13T17:55:11Z","title":"ClawGuard: A Runtime Security Framework for Tool-Augmented LLM Agents Against Indirect Prompt Injection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:17:07.080092Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.11790"},"observation_digest":"sha256:4662ae115104e50d38d90cfdcd12434215d5f8717ccd6cfc06c550e5a1d07615","observation_id":"da1adabd-becb-436d-9e3b-2f0faaeec788","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.11867","last_updated":"2026-04-13T17:40:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-13T17:40:31Z","title":"Disposition Distillation at Small Scale: A Three-Arc Negative Result","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-10T16:09:21.845152Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.11867"},"observation_digest":"sha256:2fa62048af84382e0d2ac6d3a56873b886f3cf96b04974db2c66f81dfcdba467","observation_id":"39b5c90c-9661-479e-a685-fe7f33a6264b","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.12700","last_updated":"2026-04-14T13:07:54Z","snapshot_observed_at":"2026-07-06T23:00:51.385974Z","submitted_at":"2026-04-14T13:07:54Z","title":"MISID: A Multimodal Multi-turn Dataset for Complex Intent Recognition in Strategic Deception Games","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T14:40:39.440282Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.12700"},"observation_digest":"sha256:90215d882b8736d5d493a6383b0f3e5ff8fe6ddf017ad8eb59d0b52e3981a9c2","observation_id":"0f67708f-8d6e-4cc8-90f0-fae9ba2a1827","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2604.24715","last_updated":"2026-04-27T17:23:37Z","snapshot_observed_at":"2026-08-02T10:33:56.860167Z","submitted_at":"2026-04-27T17:23:37Z","title":"Long-Context Aware Upcycling: A New Frontier for Hybrid LLM Scaling","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-08T03:39:37.485602Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2604.24715"},"observation_digest":"sha256:c658d2f1ac09a574d8595758c9404dab359bf45e8132f569c9d638d6ded8a9a2","observation_id":"efaa45f3-60b0-4416-9126-253f1830d444","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.01333","last_updated":"2026-05-08T01:08:56Z","snapshot_observed_at":"2026-08-04T10:46:08.275509Z","submitted_at":"2026-05-02T09:08:33Z","title":"OralMLLM-Bench: Evaluating Cognitive Capabilities of Multimodal Large Language Models in Dental Practice","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-11T01:03:50.055081Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.01333"},"observation_digest":"sha256:1de82f70da8eb0de41ca11c1f84c0504bf2d63b1fb1802f2466e8ad53f22611c","observation_id":"ac351d55-cee3-4002-870c-fd6dc7686261","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.02821","last_updated":"2026-05-07T06:51:57Z","snapshot_observed_at":"2026-08-02T11:27:54.086295Z","submitted_at":"2026-05-04T16:59:07Z","title":"When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T01:27:54.164991Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.02821"},"observation_digest":"sha256:377da3f855a210b534e20dea8648ef6f0fed39344723c3867c3c50a5ba9e2e55","observation_id":"700f524e-a97b-48d2-b68a-10ebd624ece3","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.02821","last_updated":"2026-05-07T06:51:57Z","snapshot_observed_at":"2026-08-02T11:27:54.086295Z","submitted_at":"2026-05-04T16:59:07Z","title":"When Is the Same Model Not the Same Service? A Measurement Study of Hosted Open-Weight LLM APIs","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T16:57:26.334739Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.02821"},"observation_digest":"sha256:b857961e9d23423014c013c78f0adcf2d6d73221d029e007c659af4abae010fa","observation_id":"8709af53-2f17-4b2d-b7cc-ac5f60bdd131","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.05066","last_updated":"2026-05-06T16:01:43Z","snapshot_observed_at":"2026-07-06T23:17:43.402046Z","submitted_at":"2026-05-06T16:01:43Z","title":"The Impossibility Triangle of Long-Context Modeling","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T17:17:44.033300Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.05066"},"observation_digest":"sha256:56c06e01bd1423fc1e20a1a6e91015e83516a853274f2c8e49674703566d9053","observation_id":"3225da1d-0068-4b81-a447-c7ca3b7877b8","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.05838","last_updated":"2026-05-07T08:12:09Z","snapshot_observed_at":"2026-07-06T23:18:22.301347Z","submitted_at":"2026-05-07T08:12:09Z","title":"MDN: Parallelizing Stepwise Momentum for Delta Linear Attention","version":1},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-09T15:27:55.566795Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.05838"},"observation_digest":"sha256:a8a510525f25a35815c114c20d23ed9b44b36be5aca23e0eb7cdc774b9ca8ebe","observation_id":"55dcb398-add9-4c41-9f4b-98cb451f8a15","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.06221","last_updated":"2026-05-07T13:18:08Z","snapshot_observed_at":"2026-08-04T15:36:16.480613Z","submitted_at":"2026-05-07T13:18:08Z","title":"UniPrefill: Universal Long-Context Prefill Acceleration via Block-wise Dynamic Sparsification","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-08T10:43:01.724760Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.06221"},"observation_digest":"sha256:ec443282d1efd407d436b3d79106f00980bca26d2b3fbcdab2640351560e9ae8","observation_id":"d09d34ce-851e-428a-b575-500410bb32d5","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.07363","last_updated":"2026-05-08T07:19:34Z","snapshot_observed_at":"2026-07-06T23:19:46.018236Z","submitted_at":"2026-05-08T07:19:34Z","title":"MISA: Mixture of Indexer Sparse Attention for Long-Context LLM Inference","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-11T02:27:55.991919Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.07363"},"observation_digest":"sha256:660d03afb4d26b3a40509f98a069e990920309d34f30c501dbfe2905119774ca","observation_id":"1d8eaca9-34ec-4343-ad59-a6f847d3af5e","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-02T08:23:54.521582Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-12T04:03:34.773345Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:fbebf9fb348ccb3e27626d2d471b739d47c747129c95e8b147b8f4529c745900","observation_id":"7f19f137-4353-4a55-ac88-3c5ab6a3a62b","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.09505","last_updated":"2026-05-13T15:59:22Z","snapshot_observed_at":"2026-08-02T08:23:54.521582Z","submitted_at":"2026-05-10T12:27:32Z","title":"EpiGraph: Building Generalists for Evidence-Intensive Epilepsy Reasoning in the Wild","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-14T21:25:31.662152Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.09505"},"observation_digest":"sha256:2b4a6b0e8a1299b67fa7f8a6afc6a4a279a591f2b86272e63fa81746fa2a3303","observation_id":"228575b1-9198-4f75-a558-f970e38a90bb","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.11733","last_updated":"2026-05-12T08:15:04Z","snapshot_observed_at":"2026-07-06T23:23:30.499023Z","submitted_at":"2026-05-12T08:15:04Z","title":"Position: LLM Inference Should Be Evaluated as Energy-to-Token Production","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-13T05:17:24.147248Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.11733"},"observation_digest":"sha256:5994e3feab752f2fa6060ee6299fbf143f199668d54a546a429b7d6cd2659f4f","observation_id":"f588b8c9-2806-4213-be57-769b4169f552","resolution":{"observed_at":"2026-05-16T06:26:38.921226Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.18430","last_updated":"2026-05-18T14:03:41Z","snapshot_observed_at":"2026-07-06T23:29:20.279470Z","submitted_at":"2026-05-18T14:03:41Z","title":"Text2CAD-Bench: A Benchmark for LLM-based Text-to-Parametric CAD Generation","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T12:48:19.704406Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.18430"},"observation_digest":"sha256:77f2fee2441c8b8884fca9777bbda51b550cfc7a692af8a0290770c0819e3ce3","observation_id":"8bf94a16-1a1c-41d9-a149-1f628ad911c8","resolution":{"observed_at":"2026-05-20T12:53:17.765087Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.18848","last_updated":"2026-06-04T09:09:51Z","snapshot_observed_at":"2026-08-03T02:32:15.025703Z","submitted_at":"2026-05-13T08:06:48Z","title":"Exact Linear Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T20:58:21.512157Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.18848"},"observation_digest":"sha256:1bf8fb9de101f5bb605ebe7b5ef82a175b7a358266a0b5b9f767bd9dd8999be9","observation_id":"1501e24d-69b3-4e98-8d61-69998b07d431","resolution":{"observed_at":"2026-05-20T20:59:01.534780Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.18848","last_updated":"2026-06-04T09:09:51Z","snapshot_observed_at":"2026-08-03T02:32:15.025703Z","submitted_at":"2026-05-13T08:06:48Z","title":"Exact Linear Attention","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-21T08:44:58.108341Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.18848"},"observation_digest":"sha256:203c2537ac5bd51a222b547c61c3fd74a1a68f173dba508f219a0cfc559d3c02","observation_id":"81d0f246-f5e9-4ce9-bd6c-4483dce2661b","resolution":{"observed_at":"2026-05-21T08:49:53.935730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.18848","last_updated":"2026-06-04T09:09:51Z","snapshot_observed_at":"2026-08-03T02:32:15.025703Z","submitted_at":"2026-05-13T08:06:48Z","title":"Exact Linear Attention","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T21:45:51.507382Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.18848"},"observation_digest":"sha256:0a4f4326cfb9ec1e68825f04c0d4c9c497893a9fc4a21afebca270f83d8e00bb","observation_id":"b36a1873-d35d-4f0f-ac3b-4c1e33d9a878","resolution":{"observed_at":"2026-07-01T14:25:45.806380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2605.29421","last_updated":"2026-05-28T06:14:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-28T06:14:49Z","title":"Learning Design Skills as Memory Policies for Agentic Photonic Inverse Design","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T08:02:27.359309Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2605.29421"},"observation_digest":"sha256:c4663aa08618fb1693abc99810f8bb1eb06afae963388d28426a3a5ec3c06803","observation_id":"706d01f6-b00d-442f-8919-fde418195236","resolution":{"observed_at":"2026-06-29T08:03:13.861236Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.00750","last_updated":"2026-05-30T14:34:02Z","snapshot_observed_at":"2026-07-06T23:41:24.911421Z","submitted_at":"2026-05-30T14:34:02Z","title":"I-WebGenBench : Evaluating Interactivity in LLM-Generated Scientific Web Applications","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:18.645984Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.00750"},"observation_digest":"sha256:f8ee360f53f6697a5d4d4c5532134c1b6593b5ffe7d4cbbf6bf5c199159d1533","observation_id":"0d1b6457-13f8-4a4e-8741-38ea5d9a7eee","resolution":{"observed_at":"2026-06-28T19:42:36.177475Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.05920","last_updated":"2026-06-04T09:24:30Z","snapshot_observed_at":"2026-08-02T02:57:59.407739Z","submitted_at":"2026-06-04T09:24:30Z","title":"Asuka-Bench: Benchmarking Code Agents on Underspecified User Intent and Multi-Round Refinement","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-06-28T00:26:22.041924Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.05920"},"observation_digest":"sha256:aaa3a89b9a335f93196c9d52ed6e4303fe34ad90c24155a56eec2b368671a9bb","observation_id":"db43bba0-673c-46e1-ac58-cacb77edd73a","resolution":{"observed_at":"2026-07-02T14:27:04.317255Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.06467","last_updated":"2026-06-04T17:54:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-06-04T17:54:04Z","title":"You Only Index Once: Cross-Layer Sparse Attention with Shared Routing","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T01:06:04.896501Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.06467"},"observation_digest":"sha256:069662b321f1ed5fee1cca7c030e763d5c3c6809a38f971320d786eac0ce132c","observation_id":"9b2131ca-4824-4aa8-a247-4929cd1dfbd3","resolution":{"observed_at":"2026-07-02T13:36:59.564415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.07597","last_updated":"2026-05-29T06:08:57Z","snapshot_observed_at":"2026-07-29T16:14:13.340722Z","submitted_at":"2026-05-29T06:08:57Z","title":"Repetition Mismatch: Why Data Mixture Experiments Don't Scale and How to Fix Them","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-28T23:19:22.355753Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.07597"},"observation_digest":"sha256:63b155f9ad9c87b426856ead6482a7d7cfffa8d698c3a13b7dc3d6a6b8ffff96","observation_id":"997b2ac0-2e84-48f7-97fd-80e477a23c2a","resolution":{"observed_at":"2026-06-28T23:22:46.220068Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.09441","last_updated":"2026-06-08T12:50:13Z","snapshot_observed_at":"2026-08-03T04:43:09.780812Z","submitted_at":"2026-06-08T12:50:13Z","title":"SIFT: Selective-Index For Fast Compute of RAG Prefill by Exploiting Attention Invariance","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-27T16:24:31.109508Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.09441"},"observation_digest":"sha256:c0386ac5a5dc762c1d8825251fa2840e8d5911ef9f1007995ff867199291a86a","observation_id":"9886cd55-1e75-4bc2-aa85-35f009651b3e","resolution":{"observed_at":"2026-07-03T01:37:31.233073Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.13392","last_updated":"2026-06-11T14:23:41Z","snapshot_observed_at":"2026-08-01T14:56:42.323551Z","submitted_at":"2026-06-11T14:23:41Z","title":"MiniMax Sparse Attention","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-06-27T06:29:46.190303Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.13392"},"observation_digest":"sha256:c53d1bc2a0995b052b196969be0d183c4a264a7611a60b6dc3167b76e96ef84c","observation_id":"a037c08f-918a-4be7-9e33-2a96be25df55","resolution":{"observed_at":"2026-07-03T15:28:34.108034Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T11:29:32.433234Z","title":"Minimax-01: Scaling foundation models with lightning attention, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.14502","last_updated":"2026-07-23T02:50:21Z","snapshot_observed_at":"2026-08-04T07:54:41.453095Z","submitted_at":"2026-06-12T14:33:55Z","title":"From Chatbot to Digital Colleague: The Paradigm Shift Toward Persistent Autonomous AI","version":2},"reference_index":150,"source":"pdf_text","source_observed_at":"2026-08-02T11:29:32.433234Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.14502"},"observation_digest":"sha256:c5b91de10f452750b71e096ef83cb6be450eeabd41da9e0d20766ea8335babc6","observation_id":"000d381e-f945-4d26-8741-2c315dd81ba8","resolution":{"observed_at":"2026-08-02T11:29:32.433234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.16533","last_updated":"2026-07-03T04:30:36Z","snapshot_observed_at":"2026-07-12T13:47:19.539499Z","submitted_at":"2026-06-15T10:37:42Z","title":"Kairos: A Regret-Aware Native World-Action Model Stack for Physical AI","version":2},"reference_index":183,"source":"pdf_text","source_observed_at":"2026-06-27T04:02:53.110012Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.16533"},"observation_digest":"sha256:46fc27c5f4a7486b77cf9e8cf99cbfe45585d2cf11ce3001f23119b8b0db8c09","observation_id":"8fcfcd22-d17c-4ac3-b190-7f3fda49cd85","resolution":{"observed_at":"2026-07-03T17:28:44.967152Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.21033","last_updated":"2026-06-19T01:56:25Z","snapshot_observed_at":"2026-08-02T10:50:07.505622Z","submitted_at":"2026-06-19T01:56:25Z","title":"MoECodec: Image Compression for joint human and machine perception via Mixture-of-Experts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-26T13:12:03.271949Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.21033"},"observation_digest":"sha256:b0619bc17b7fa639318a4504c9f4063543054328c92fac8b55bc82e09db5add4","observation_id":"91a833c0-9a30-4de1-80ec-c97cfbe396d7","resolution":{"observed_at":"2026-07-04T07:39:38.956389Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.24950","last_updated":"2026-06-23T07:52:44Z","snapshot_observed_at":"2026-07-31T18:34:39.877398Z","submitted_at":"2026-06-23T07:52:44Z","title":"MacroLens: A Multi-Task Benchmark for Contextual Financial Reasoning under Macroeconomic Scenarios","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-26T01:00:02.463337Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.24950"},"observation_digest":"sha256:19d84e6d743ab1312607d6e93936f1ae16e82612bdbdfd0e58efbb23ef8f9a3a","observation_id":"1526636a-4f93-457f-82bc-e007caaa2034","resolution":{"observed_at":"2026-07-04T16:09:56.472425Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.26938","last_updated":"2026-06-25T12:13:40Z","snapshot_observed_at":"2026-08-01T16:59:54.324752Z","submitted_at":"2026-06-25T12:13:40Z","title":"Focusing on What Matters: Saliency-Harnessing Accurate Routing for Diffusion MoE","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-26T05:11:59.761865Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.26938"},"observation_digest":"sha256:183a18b807c4a3f5be989d4de0845535209399051c8113f93460aa7f85746351","observation_id":"95f96e7f-80ef-403b-aeac-c119992d545f","resolution":{"observed_at":"2026-07-04T13:29:51.526571Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.30634","last_updated":"2026-06-29T17:57:50Z","snapshot_observed_at":"2026-08-02T16:54:35.399479Z","submitted_at":"2026-06-29T17:57:50Z","title":"One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T06:41:55.732230Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.30634"},"observation_digest":"sha256:0348de2e8ec3c83b06e8838a359b2b384ea5f3ce8e9d9ce17b99b898b53b31f7","observation_id":"f26578f6-3af1-41af-8fd2-87c1a49a2ea7","resolution":{"observed_at":"2026-06-30T06:44:18.897171Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":"2501.08313","doi":"10.48550/arxiv.2501.08313","metadata_source":"pith","pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","venue":"cs.CL","work_id":"137e6ed4-1c1d-40bd-801e-9d2baea0bd0c","year":2025},"citing_paper":{"arxiv_id":"2606.31467","last_updated":"2026-06-30T10:46:23Z","snapshot_observed_at":"2026-07-07T00:05:12.546815Z","submitted_at":"2026-06-30T10:46:23Z","title":"AeroVerse-SatAgent: UAV-Satellite Collaborative Spatial Reasoning Inspired by the Dual Visual Pathway Theory of Cognitive Neuroscience","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-01T06:18:35.494240Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2606.31467"},"observation_digest":"sha256:d31151974653f4bd2bb47785a0e79aa49704e61f05d80437fb5137ac525824f3","observation_id":"a0a682e5-c591-43a5-bc88-691f7ab343e7","resolution":{"observed_at":"2026-07-01T09:45:39.833249Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-11T22:11:17.609849Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.04031","last_updated":"2026-07-04T21:19:49Z","snapshot_observed_at":"2026-08-01T15:29:48.939401Z","submitted_at":"2026-07-04T21:19:49Z","title":"TileLens: Efficiently Using Large-Granularity Memory Systems with Transparent Two-Dimensional Memory Layout","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-11T22:11:17.609849Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.04031"},"observation_digest":"sha256:f08186566d288baf27094ed3145ed318a36cb29aa13cd47c5a5c8780c20d3de9","observation_id":"0597f712-b328-4e5f-abe0-6cc59828d3ae","resolution":{"observed_at":"2026-07-11T22:11:17.609849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-07-13T00:53:20.749426Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.09029","last_updated":"2026-07-10T01:31:02Z","snapshot_observed_at":"2026-07-15T23:18:00.618125Z","submitted_at":"2026-07-10T01:31:02Z","title":"MOSAIC: Adaptive Inter-layer Composition for Efficient Heterogeneous Vision-Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T00:53:20.749426Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.09029"},"observation_digest":"sha256:b77388b3436cd5d1c5b83189c9b1bbe7675c00e53b45064a236efe14571a4396","observation_id":"3e14401c-64c0-47bb-9163-d80145054659","resolution":{"observed_at":"2026-07-13T00:53:20.749426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T03:08:34.681235Z","title":"MiniMax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14018","last_updated":"2026-07-15T16:50:43Z","snapshot_observed_at":"2026-08-02T03:08:30.142623Z","submitted_at":"2026-07-15T16:50:43Z","title":"Transforming Rank: How Architecture Navigates the Spectral Pathologies of Depth","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T03:08:34.681235Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.14018"},"observation_digest":"sha256:e1b9870209839b08e7fe194bdc2f64c8043ae505194df214a3b196c56dccc87f","observation_id":"7a6800d9-0742-4de5-b3a5-7b6ece99915e","resolution":{"observed_at":"2026-08-02T03:08:34.681235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T06:39:23.351213Z","title":"MiniMax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T02:11:08.052074Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:23.351213Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:b5eb31ef275ba6bcfe84dbc2a19df0d6ef22db8f4f7e6658a1102a7ab7b195d5","observation_id":"48d550e0-9866-4015-b7a5-8de17b06aa84","resolution":{"observed_at":"2026-08-02T06:39:23.351213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-03T02:03:25.363111Z","title":"MiniMax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-05T02:11:08.052074Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:25.363111Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:21a4443a374824c0ba22980254f2bd22ce0782e95046537e82bdabbbe864208d","observation_id":"306bfd41-a9ac-42fe-8b08-b3b61a28e156","resolution":{"observed_at":"2026-08-03T02:03:25.363111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T12:48:54.132284Z","title":"arXiv:2501.08313 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19358","last_updated":"2026-05-29T03:05:29Z","snapshot_observed_at":"2026-08-02T21:18:00.004024Z","submitted_at":"2026-05-29T03:05:29Z","title":"LISA: Linear-Indexed Sparse Attention for Efficient Long-Context Reasoning","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-02T12:48:54.132284Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.19358"},"observation_digest":"sha256:d467f6a07b315fa1805f640332061c946af021f16a42c534bf08217df3927619","observation_id":"14d80a31-c68c-4dd0-8df0-39123973a78c","resolution":{"observed_at":"2026-08-02T12:48:54.132284Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.08313","snapshot_observed_at":"2026-08-02T06:45:16.519251Z","title":"Minimax-01: Scaling foundation models with lightning attention.arXiv preprint arXiv:2501.08313, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.20548","last_updated":"2026-07-13T21:47:08Z","snapshot_observed_at":"2026-08-03T03:46:04.260858Z","submitted_at":"2026-07-13T21:47:08Z","title":"SOAP, Muon, and Beyond: Pushing LLM Pretraining Scales","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T06:45:16.519251Z"},"links":{"cited_paper":"/paper/2501.08313","citing_paper":"/paper/2607.20548"},"observation_digest":"sha256:a01ef556149550919c8301ce1e3e96cbb83d764038bb09789037d2d5a0bea862","observation_id":"3c457dcc-ced8-4f86-8e6d-43d37c92b5be","resolution":{"observed_at":"2026-08-02T06:45:16.519251Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2501.08313/citation-record","integrity":"/paper/2501.08313/integrity","json":"/paper/2501.08313/citation-record.json","paper":"/paper/2501.08313"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":"2409.02813","doi":null,"metadata_source":"pith","pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-07-08T19:35:32.916072Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","venue":"cs.CL","work_id":"19883673-604e-4b58-b036-5a04ec11a6f9","year":2024},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:7cb2c34d9783ed7ff22e520e0d1bd338f582ce54ae8311aa9e859db6fea23dff","observation_id":"52010afa-8fd0-4a6e-bf6c-6be316561a6c","resolution":{"observed_at":"2026-05-16T06:26:38.699617Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"867d8b23-3ef8-4fc0-a5df-fab6d2061b82","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:7b990b6d5d2bef32308e073cb71e498c5b71636d5aeb5ca0798b34596b5c57ab","observation_id":"de9885bc-bfbc-4aa3-be2e-d6a1bfa726e2","resolution":{"observed_at":"2026-05-16T06:26:38.882376Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This process repeats iteratively until the response is complete, ensuring that every sentence in the output aligns with human preferences","venue":null,"work_id":"c10721d0-f73c-44f8-b171-d2e0ad18b803","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:684614c858b96b4b893d066e4a66ae36f31e8d543ae482734191ac9584d0a515","observation_id":"50af0b87-f250-4e48-8a44-cf8773550a5d","resolution":{"observed_at":"2026-05-16T06:26:38.886142Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The training objective is to mini- mize the negative log-likelihood loss between the model’s output and the corrected answer","venue":null,"work_id":"026f6528-4c9f-4626-9640-19cbbdaca167","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:01b3935f6a206852c15ba317217c6a71596e24c676f9531a35946305e0ef3eb8","observation_id":"8499b188-36a5-4391-8a78-1e700e7b111d","resolution":{"observed_at":"2026-05-16T06:26:38.890943Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"db0f776f-370c-4835-9a2d-30612a6feb19","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:e14a8050a5afba96c90410ea647a5aed490f9d1c8985d1e791cb1b6a1ea25d8c","observation_id":"d9334395-c75f-446a-a918-73ac815bd78a","resolution":{"observed_at":"2026-05-16T06:26:38.897336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"• Generation Methods:The study compares the classic sentence-by-sentence correction pipeline with a new continue generation pipeline","venue":null,"work_id":"c3483e24-e14e-4871-9c8f-ba8618a9cdae","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:a70acd3fe4ab9b3980bda88168f92779865e21fe988e44dd11c679b33ef15b6f","observation_id":"3ab095c7-a182-4833-b76a-521320ec0ee8","resolution":{"observed_at":"2026-05-16T06:26:38.900336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It also achieves the performance of Aligner-70B using only 2B parameters, showcasing both superior performance and efficiency","venue":null,"work_id":"5c9d3efd-978c-482b-9f48-13d90b02c720","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:314bb1460b2aec851ca22fe7b314dba9ee13619d226447ad7b4dd1538ba4ed1b","observation_id":"55701cb4-e343-4a72-8dc3-a2d248d8d032","resolution":{"observed_at":"2026-05-16T06:26:38.904587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"877b3802-ac47-48dc-af54-943061f29bec","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:48707bfaea6e3a1d603263d02ada6e5a12ae3e92281b45930c322f31c32b1973","observation_id":"e63eab76-754b-4583-ab9d-bfc4359c4510","resolution":{"observed_at":"2026-05-16T06:26:38.908642Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"It achieves significant improvements in helpfulness, harmlessness, and reasoning abilities, making it a promising approach for aligning LLMs with human values","venue":null,"work_id":"e88a95dc-d7a0-4119-b439-186c7fe3e88a","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:806afa0597c829f954085d2556a830b92da6832540903f04c954da30f39a3521","observation_id":"80411abb-1a1a-4ce5-b47a-0bbf87fba682","resolution":{"observed_at":"2026-05-16T06:26:38.912395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cbe567a8-cab0-423f-80a2-f322aca02ec8","year":1940},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:3362531b1bfc2805a6ba9c5fb2318f033cd61dc78b10c36c76cdc349fcbbec29","observation_id":"e53e8b88-7999-4632-bb59-6f16e9752b58","resolution":{"observed_at":"2026-05-16T06:26:38.915578Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e9758614-4dbf-4445-87a4-ac71133cc7c4","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:2223a9946f56fd879c0d980ef4ae5d1d82328e21795df6b25d4aa7698120604f","observation_id":"904c42f4-6e68-4a37-a8d3-255c7cbe05dd","resolution":{"observed_at":"2026-05-16T06:26:38.919758Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"neurones multimodaux","venue":null,"work_id":"53ae3579-e09d-4263-aae2-cfa4c467766b","year":2021},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:47c0c043b0897347810af059acdc54372f0a471c95979513bb63e3065c9ea461","observation_id":"536b43cc-7f5a-49e8-a036-f008fe47a973","resolution":{"observed_at":"2026-05-16T06:26:38.704489Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Traduisez cette phrase du chinois à l’anglais","venue":null,"work_id":"9487c975-d74b-48bc-b013-b3e9644f683a","year":1956},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:e792da781cc24289afd5a1e113293622edfaf81ad69c2c1e78fb8fb34950358c","observation_id":"92eedfeb-55ce-4793-89c7-7c5410e85c4a","resolution":{"observed_at":"2026-05-16T06:26:38.708923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f9045070-6aa7-4120-8ca1-502ca63e6220","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:abad07f7eb8ac506355fb3ad4f6203a6c9d95a5e5c37bd68a33dce94ff3e537b","observation_id":"2c8e47ba-08bf-407c-8a2c-9415e7d2450b","resolution":{"observed_at":"2026-05-16T06:26:38.712843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nous avons égale- ment discuté de l’évolution, des limitations et de l’avenir de l’AGI","venue":null,"work_id":"34c06734-6cb2-470c-9cb7-d58f6b2af577","year":2012},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:8f49e5ee02824dbcc196779ae49efe75ebb2aa38edc862ab6f85fb39ba9a79fe","observation_id":"b87eb815-df59-47df-bd77-1f403273bcb5","resolution":{"observed_at":"2026-05-16T06:26:38.716836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Shigihara Y, Zeki S","venue":null,"work_id":"76aad67d-d990-43cd-9da3-cd0e3dc4d207","year":2014},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:d7556e8906bf88522043f49255a12a3b17547b47a5dfee17e80f5b8052192122","observation_id":"cba3d9af-a2f5-4e86-ba5e-3025f1c3383a","resolution":{"observed_at":"2026-05-16T06:26:38.720560Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Neuroplasticité","venue":null,"work_id":"886ff4c8-31ff-4a24-9c93-e724b507bfb6","year":2017},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:0991e8597e5e947244a0f0a185b57389548090cc19f56846a32a550a28cb72bf","observation_id":"a5ca0cd6-500b-460e-83bc-97485fe1feff","resolution":{"observed_at":"2026-05-16T06:26:38.723980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Champs ré- cepteurs, interaction binoculaire et archi- tecture fonctionnelle dans le cortex visuel du chat","venue":null,"work_id":"a07e2576-f5ae-423d-9bc2-c8524db791bc","year":1962},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:df26a4f0167d949c406b0a41e149cc251fc5e1658c29f6f6b9ace6a48992b3e0","observation_id":"dd0c97cf-3b70-4daa-bd7d-4c65f2d8301e","resolution":{"observed_at":"2026-05-16T06:26:38.727749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Le système d’attention du cerveau humain","venue":null,"work_id":"8eb4aae0-6550-444d-bb62-e6db6b54b857","year":1990},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:1759dd43c6b2520738f5b9ca12a4ef8ac04b030228fd0e56fe920085d06fd628","observation_id":"41a7893f-9321-4fce-86da-020e6158dc4b","resolution":{"observed_at":"2026-05-16T06:26:38.731448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford A, Narasimhan K, Sali- mans T, Sutskever I","venue":null,"work_id":"f832cb1b-6a01-4097-a616-a45fd3d438d4","year":2018},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:9a5534e81b1fc7d85d0d7081d456b424249a0c904953067d0a44339fb9a0890b","observation_id":"f1ef7688-07c0-41a3-b79d-534064e28475","resolution":{"observed_at":"2026-05-16T06:26:38.734952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bassett DS, Bullmore E","venue":null,"work_id":"4d4eb82d-e659-47c6-ba62-cc8d68fc21ea","year":2006},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:c4e5ba9f8ebbb1d1fdce47fd9c96fc8cfa8919fbb1ba286b77deb5e6e2a15c96","observation_id":"956ac970-b47d-4b68-9f07-1256ee015c55","resolution":{"observed_at":"2026-05-16T06:26:38.738392Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xie S, Kiril–lov A, Girshick R, He K","venue":null,"work_id":"410a4e90-9ade-44ba-93ed-35d039925f9f","year":2019},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:684a6879e2e740207d6bee98add7b68bb160dc3844b2c33986fd466fff5ec1cb","observation_id":"e5791146-ec1d-4721-a05c-91b34f37eec3","resolution":{"observed_at":"2026-05-16T06:26:38.741790Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhao L , L, Dai H, Wu Z, et al","venue":null,"work_id":"b3d32945-18ce-4fbf-94cd-1c6f9169f0cf","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:1dea33af6e50914cff778348c3ce9c7ba7b4387ea44347b1ecf31bddfc79b445","observation_id":"42df7ad6-ef3c-4d67-998f-d51ff80c13f8","resolution":{"observed_at":"2026-05-16T06:26:38.745399Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yu X, Zhang L, Dai H, et al","venue":null,"work_id":"5510ba72-ebe4-42c8-82bd-48e12ea1a491","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:a11443a73a8345fdd6552983ca308d20f3b152d329dc1e9880dd8bdab5795cf4","observation_id":"6f2fd073-aee5-4d57-b702-e8217ea7a4f2","resolution":{"observed_at":"2026-05-16T06:26:38.748838Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhao L, Dai H, Wu Z, Zhu D, Liu T, Cnn CP-","venue":null,"work_id":"9aae52a3-2eb6-494f-9bac-310fbdfc25d7","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:143be407f2ec1bd50d1e363e841ad5d0ad8025b0d9a6493b835f232b03863b58","observation_id":"c8c38096-0aeb-40e7-a7a5-df658813ab64","resolution":{"observed_at":"2026-05-16T06:26:38.751989Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ghosh-Dastidar S, Adeli H","venue":null,"work_id":"9928461b-9273-4fb2-8e79-6c4998336f41","year":2009},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:8f1e3dad286abe7aa6ad55dab61069bae13dd809c3346617e0ce9a3be7466dc3","observation_id":"f407a3e8-5b7c-49ca-8673-1571a68a8e5a","resolution":{"observed_at":"2026-05-16T06:26:38.755095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Créer des robots plus intelligents grâce au cal- cul inspiré du cerveau","venue":null,"work_id":"bf2d6389-b1fe-42fb-955f-20c1d4c95f9e","year":2016},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:c00206882319547721dc761c47076f14a8e6053181952807705534f982381b7f","observation_id":"42591909-ab5a-49be-94bf-4ce1bd65bb33","resolution":{"observed_at":"2026-05-16T06:26:38.758960Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vers une intelligence machine basée sur les pointes avec le calcul neuromorphique","venue":null,"work_id":"e327413c-5472-43f3-994c-7268363f706a","year":2019},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:47ed9dd9cc31ad3945ffd1b1076cb25036e99011f027d9b5a5bdce8b38aee016","observation_id":"015844f6-4a1e-4866-84bb-883500c0a75b","resolution":{"observed_at":"2026-05-16T06:26:38.762819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"TrueNorth : conception et flux de travail d’une puce neurosynaptique pro- grammable d’un million de neurones de 65 mw","venue":null,"work_id":"5a8fe0f3-b4bd-4abe-b860-4a204fbdd2dc","year":2015},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:35f1973beb04e01a729488a41a82d6c2c2d45579b79bdc684b52fca60de0c874","observation_id":"a8038008-746d-4a7a-9ee4-f2284c4822cc","resolution":{"observed_at":"2026-05-16T06:26:38.767523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Indiveri G, Douglas R","venue":null,"work_id":"4fbcdae2-b99f-48cd-950d-537f9dbc6862","year":2000},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:da997343e4323b6246bff788077fa29eeecaf22cc952ed536ea49dfd32d0cf9d","observation_id":"156d6f73-bb58-44ea-8a81-8a55dc62f7e8","resolution":{"observed_at":"2026-05-16T06:26:38.771113Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devlin J, Cha–ng MW, Lee K, Toutanova K","venue":null,"work_id":"23cd4d32-1d39-45b1-8d82-8f9965486dda","year":2019},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:2c919f0e3cf59dba6c786db69ab2016757f6c365999ec2f974768c22371630b7","observation_id":"08c323d1-4c42-4b0f-865e-33cace319b40","resolution":{"observed_at":"2026-05-16T06:26:38.775135Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amélioration de la com- préhension du langage par la pré-formation générative","venue":null,"work_id":"a5303618-2513-4f73-ac02-4f3a6ef94cb0","year":2018},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:d6a533924f949ed2b03f45df24db92619c57c5c6ac28fb8ebd4c24ba2de33949","observation_id":"ca6b9105-631a-443e-b6db-3b1a2479f12c","resolution":{"observed_at":"2026-05-16T06:26:38.779604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:442e912aea373a27a32adfa1abce2cf7454013673058f09691c3aefa4aeb5c4a","observation_id":"ee041a18-4a85-413c-aebd-6dc5bcfc9a12","resolution":{"observed_at":"2026-05-16T06:26:38.653364Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.01108","last_updated":"2020-03-01T02:57:50Z","snapshot_observed_at":"2026-08-03T03:32:02.223426Z","submitted_at":"2019-10-02T17:56:28Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","version":4},"cited_work":{"arxiv_id":"1910.01108","doi":"10.48550/arxiv.1910.01108","metadata_source":"pith","pith_arxiv_id":"1910.01108","snapshot_observed_at":"2026-07-11T02:57:46.620845Z","title":"DistilBERT, a distilled version of BERT: smaller, faster, cheaper and lighter","venue":"cs.CL","work_id":"756f9764-ecd6-4672-8043-b37c698c7ad2","year":2019},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/1910.01108","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:84342319b8ead5389b6a8bd89000e06ee4b0155853fa49c1f08b04bdce24cc29","observation_id":"0f450d1a-5a13-489e-a6af-a4f10aa37aff","resolution":{"observed_at":"2026-05-16T06:26:38.670594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:a4a7be654f51e51285d3665ce37bb73816b33b679b967d9ae3b366593ffb3a0a","observation_id":"be888aa7-5ee0-4438-83c4-eda59be1c32d","resolution":{"observed_at":"2026-05-16T06:26:38.683079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":"2110.08207","doi":"10.48550/arxiv.2110.08207","metadata_source":"pith","pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","venue":"cs.LG","work_id":"1857c952-db2f-4810-9e3c-27a862c8d276","year":2021},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:60bfd1c0ce6e079b5c4d8e58196c9eef04c9cad1dca51f128db694a9d4bc6da6","observation_id":"4c4cee9f-7db3-4662-bf58-b319e5e65482","resolution":{"observed_at":"2026-05-16T06:26:38.688305Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.13474","last_updated":"2023-02-27T21:26:48Z","snapshot_observed_at":"2026-07-06T12:52:16.992962Z","submitted_at":"2022-03-25T06:55:15Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","version":5},"cited_work":{"arxiv_id":"2203.13474","doi":"10.48550/arxiv.2203.13474","metadata_source":"pith","pith_arxiv_id":"2203.13474","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"CodeGen: An Open Large Language Model for Code with Multi-Turn Program Synthesis","venue":"cs.LG","work_id":"892a192d-205a-4079-a807-00d7874b392e","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2203.13474","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:6ba9b7fbbac88abe708f32be42c7f2b43ca2156b2a4bfd4912a67298098a53df","observation_id":"386de7b3-4b36-40d4-bbcc-7dc5c61925f2","resolution":{"observed_at":"2026-05-16T06:26:38.694077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:e4a1721fb8f015d732c5d6844dd6d529cd2035179b843f0d286c87bea8257d4c","observation_id":"4b54afb2-b5b9-488b-8db0-17fa88158b11","resolution":{"observed_at":"2026-05-16T06:26:38.632248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.01786","last_updated":"2023-05-29T16:40:37Z","snapshot_observed_at":"2026-07-06T14:13:58.277553Z","submitted_at":"2022-11-03T13:19:32Z","title":"Crosslingual Generalization through Multitask Finetuning","version":2},"cited_work":{"arxiv_id":"2211.01786","doi":"10.48550/arxiv.2211.01786","metadata_source":"arxiv_reference","pith_arxiv_id":"2211.01786","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Crosslingual generalization through multitask ﬁnetuning","venue":"arXiv (Cornell University)","work_id":"b4e14028-01ab-41ea-a454-23b4a72a4cf0","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2211.01786","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:6d38f806e703f6aa7963e54a4ce70a21b8a2ce6b5e50b86bc319e669cd250547","observation_id":"da3810f0-ad63-4b9b-af39-5bdd428f222b","resolution":{"observed_at":"2026-05-16T06:26:38.644752Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jurassic-1 : Détails techniques et éval- uation","venue":null,"work_id":"a2cec977-3612-4833-9fa0-fc56cc839153","year":2021},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:06cca67041685d61d92adb6ca09c51453f401a5e889800766ae52ff76bc2c11a","observation_id":"4769a396-1bf0-43d5-bacc-d4820445d8b2","resolution":{"observed_at":"2026-05-16T06:26:38.783816Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.11446","last_updated":"2022-01-21T18:39:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T19:41:47Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","version":2},"cited_work":{"arxiv_id":"2112.11446","doi":"10.48550/arxiv.2112.11446","metadata_source":"pith","pith_arxiv_id":"2112.11446","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training Gopher","venue":"cs.CL","work_id":"47ce8be9-e500-407d-af41-ac2d132215eb","year":2021},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2112.11446","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:5afed0b3233a3ea9b1742e22a222422d2698c580993fcb9ab5d407f178143ed6","observation_id":"571e33ad-8893-4d12-925e-72cac4399069","resolution":{"observed_at":"2026-05-16T06:26:38.659096Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.02137","last_updated":"2021-07-05T16:54:59Z","snapshot_observed_at":"2026-07-06T11:26:04.679324Z","submitted_at":"2021-07-05T16:54:59Z","title":"ERNIE 3.0: Large-scale Knowledge Enhanced Pre-training for Language Understanding and Generation","version":1},"cited_work":{"arxiv_id":"2107.02137","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.02137","snapshot_observed_at":"2026-07-04T09:49:44.483372Z","title":"arXiv preprint arXiv:2107.02137 , year=","venue":null,"work_id":"a6d1bbcd-82f9-438e-b837-c250e0bea6d9","year":2021},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2107.02137","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:b490f02211dbf38a406b9cdae5e1dc11c7aa6144cd12bef0e0f1e2940906f7d9","observation_id":"1d60456d-432a-4c76-8533-b2f181a1c9c4","resolution":{"observed_at":"2026-05-16T06:26:38.665017Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fun and Dystopia with Ai- BasedCodeGenerationUsingGpt-J-6b,June","venue":null,"work_id":"1595b2ec-dc89-4305-92b5-b2c76581cf4f","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:e232a22a9f06320dd66c87eaf001519440bcc1fc2a53941806e23d5dc64c64e2","observation_id":"1a044d63-ef83-4401-8645-d22d52d6467c","resolution":{"observed_at":"2026-05-16T06:26:38.787730Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":"2204.06745","doi":"10.48550/arxiv.2204.06745","metadata_source":"pith","pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","venue":"cs.CL","work_id":"168a55d5-675d-49cf-be47-a17ee8cd742e","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:c7d4d358244d37cb3f9a06bf5fad0e390940b51a82cae3ce1da8f4302934d22c","observation_id":"5cce8672-5f20-48b6-a098-6ad63f20255d","resolution":{"observed_at":"2026-05-16T06:26:38.676743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Whispers of the Lost City","venue":null,"work_id":"7ae7a9f2-2193-4b0a-862d-07a6b328b5e0","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:c53d7f12c5719921fc81e5038bbfc7b1c9ff3ef9394e07a9cf7b7c4aa6a5b7f7","observation_id":"6fae50e7-b611-4831-82d2-b0c59f378991","resolution":{"observed_at":"2026-05-16T06:26:38.791844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"703bdbe9-90bf-4fdf-a34b-eb2d96b9e97b","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:7aab80bd06748d3eaa55d036066c10d9a2e5e0dfbd0485526f632837c6becf25","observation_id":"6f8edbbf-d92b-4596-89b1-45d209192605","resolution":{"observed_at":"2026-05-16T06:26:38.795949Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Usually, there will be a speed sign on the exit ramp of the expressway, so keep an eye out for it","venue":null,"work_id":"a84e0948-ced4-47af-a8ad-460079a39dbc","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:41e3d5e43ece64ad00a15570bbcab460804180f6b417c1819cd8dbfca264c726","observation_id":"0090577a-064b-45bf-bbe0-7a9d99256881","resolution":{"observed_at":"2026-05-16T06:26:38.800078Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7b0beced-9c7d-4ab0-97ef-61374368856e","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:eb31d9de3b85a8708731ca9bff3cad27ed92ebaeb61cf3048725f91c40186dec","observation_id":"a3e6f2aa-a889-45f5-9a15-5a64d00eaa3c","resolution":{"observed_at":"2026-05-16T06:26:38.804073Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Be aware of curves and slopes on ramps and maintain an appropriate speed","venue":null,"work_id":"3e42f127-3343-4e77-875a-3769e3da53b2","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:f2d532b22e516043cd0eecc2783feac79b92100e3f98c0d563e4584077738758","observation_id":"955cf025-ec66-443a-9f3c-8033f3c9b835","resolution":{"observed_at":"2026-05-16T06:26:38.808065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Navigation will guide you through the next segments until you reach your destination","venue":null,"work_id":"1532ef4d-372f-4c89-a934-2b47151d2c23","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:d6a4854200ec5739190819f63060bc32b8ffc9b04cc6bef366094d8d085210ff","observation_id":"5b4f56d6-2c9f-4fbb-a1b9-b6855e23a502","resolution":{"observed_at":"2026-05-16T06:26:38.812203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"72030274-1d3a-4c9d-af1d-5bca36d7a745","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:4f1d3436d3ec143263ba067ea685be3377f9dcc874fcc1034ccc25e9a7f85ccb","observation_id":"d276e8e8-b7c6-4bc5-9cff-72f692f0e7a9","resolution":{"observed_at":"2026-05-16T06:26:38.815788Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bd101f2f-3048-4ba8-adfa-23b001012241","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:0ae4ea7fe3a91762442d13c10f37618ba434e894a4b448949d6c83563bff28bb","observation_id":"a93323de-e104-4ebe-810b-785f503bcf65","resolution":{"observed_at":"2026-05-16T06:26:38.818990Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Second row","venue":null,"work_id":"4bee5e23-8e19-49ca-a700-2c6c8273d086","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:808b78fc0fd4977ebb93a2f287a3381125d6f5b2feb9c858c8c0e240ed66278b","observation_id":"c4c2abf1-67ae-48e1-b709-ad880b4f272b","resolution":{"observed_at":"2026-05-16T06:26:38.822464Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8f7f9314-6a9e-4f30-bcf9-5d1300916c9d","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:4133edd4de277443f192119943a8c1d56069b4931a8def8d42aeb1284c2e7594","observation_id":"4d35c28c-65d2-4a06-b060-abb573c2c287","resolution":{"observed_at":"2026-05-16T06:26:38.825287Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"17b05772-b95c-409e-977a-5f35725e5672","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:ed41f2775517031353d07bc679205669e5500f7e9c212a512d141231687e67d8","observation_id":"c4771cec-cc04-4d47-8629-06d14abc7439","resolution":{"observed_at":"2026-05-16T06:26:38.828985Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Third row","venue":null,"work_id":"c626a425-0355-48dc-9abf-3e29da20a9e5","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:b70a8a5b7a13d6bc1adbfb6d56ed5c05b076c02def15a2dc94bfe2b5f1de06a6","observation_id":"a46bca79-c35e-41c3-a127-0ee2809765ac","resolution":{"observed_at":"2026-05-16T06:26:38.831825Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5139fc3a-6e58-4f2e-89d0-92c2a9194ccc","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:d7d428f992616f9db4a09f210c429e7424a22831438d25c16bc351b34767fe71","observation_id":"fcf663a7-712c-4b6c-9218-cad77c255101","resolution":{"observed_at":"2026-05-16T06:26:38.834994Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f76d2d91-2adf-4856-9f50-c450554aa877","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:149ec8748400b98def4cc149c8afc36b12aee8f084c7559f0430c3194d1f2c5b","observation_id":"7c1347fe-dfd4-4268-af60-480209668ab8","resolution":{"observed_at":"2026-05-16T06:26:38.839965Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e519fc54-e7a0-4b4e-b072-5be459171975","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:efb82afcfb8e7710804f07802abad720ebe5ef11940389823767b148a7c1658b","observation_id":"e93c1a5b-bbfc-4402-9f97-f2e6717b5693","resolution":{"observed_at":"2026-05-16T06:26:38.844386Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9c963dc6-ec68-4d98-838a-172fae5ece60","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:28dbea07c704485e82f0b8e1015d79e883ef84b516345d3c6e740baad1cc9dbc","observation_id":"c794769d-af61-4027-bcbb-64a28ce6c275","resolution":{"observed_at":"2026-05-16T06:26:38.848060Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a319e9cf-7e8b-439f-a06f-6aae3aa21a33","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:555c797af6f1f104431394a6b07f326b14a7e8dab05266058f5d24e95a3a82ac","observation_id":"75e919cf-0861-4294-ad3e-ceb429044dc1","resolution":{"observed_at":"2026-05-16T06:26:38.851671Z","resolver_source":"raw_fallback","status":"parse_uncertain"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enter invoice details","venue":null,"work_id":"78263c21-c422-43f7-aad5-07a841cb025b","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:d59518384f7bef014cac392122086da3e4f27949bb0279c2730f2fd7f2356b4b","observation_id":"222c7ab8-7aaf-4634-9b01-93d61d93de73","resolution":{"observed_at":"2026-05-16T06:26:38.857791Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"This will significantly reduce the time spent on manual entry","venue":null,"work_id":"c7f595c2-74c1-4050-806b-3b0dceaf8db5","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:5d91718d2eeaed109a3a0c6657b2a3e8aafeaebbec87b7a7da3cfc4da6705e88","observation_id":"62c39f62-624b-4b87-b594-253f1f532e5e","resolution":{"observed_at":"2026-05-16T06:26:38.861908Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For example, use drop-down menus, auto-fill, and smart suggestion features to reduce user input time and error rates","venue":null,"work_id":"740814eb-45ec-4894-bc90-0aa41eb91d91","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:1fcdf7feface63ad91d4e96a2081a9da931f7b8029d2a487c98d52c6e18c125a","observation_id":"3a8e1466-524d-49e2-9028-2df2218414d4","resolution":{"observed_at":"2026-05-16T06:26:38.865452Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c050a6dc-251c-4634-8cf6-2892d6774d86","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:0653a7d94977a9d129f3019c3b4a9ba25793afec240659a3f61537969cd22b20","observation_id":"d94e48e8-1838-47b6-9c5d-5466342eb8bc","resolution":{"observed_at":"2026-05-16T06:26:38.869057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e57872ca-105d-41b1-a72c-d9669bb06138","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:29d68dd8bc00b26677ea8eb544d70af3f45a0d007772169ba2b68b3296d5c87f","observation_id":"c54814cd-94b2-4c8e-ac0b-7b5f09a92347","resolution":{"observed_at":"2026-05-16T06:26:38.872123Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7527b560-5102-4641-86f2-3b9f522c4ef4","year":null},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:8a966497379d10b10654ccfc186db5ba9ba613c0f1234f2adf49e27789ab9ff6","observation_id":"4bd8b78f-a4b5-491a-81a2-bc14ef85e7cb","resolution":{"observed_at":"2026-05-16T06:26:38.875401Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enter invoice details","venue":null,"work_id":"bee48dec-9c8b-49bb-96b9-837c4497d6f0","year":2023},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:9bd06c5621fd34d96e056df0c9bd181039f030d97b8870d46156545ca1c2f4a2","observation_id":"c0a3a900-5d71-42ae-9b86-a82035b7cd93","resolution":{"observed_at":"2026-05-16T06:26:38.878919Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":5,"unresolved":15,"verified_exact":10,"verified_fuzzy":37},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 59 inbound Pith citation observations for arXiv:2501.08313."}