{"as_of":"2026-08-06T18:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:48642aabc5fdc7e357e39964da95a37565650449613c0236f892b7a72e0b6ff9","coverage":[{"denominator":78,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":78,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-24T12:10:49.690618Z","state":"measured"},{"denominator":135,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":135,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":57,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:56:44.086979Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":299,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"reference_index":145,"source":"arxiv_source","source_observed_at":"2026-05-10T23:45:06.755839Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2204.02311"},"observation_digest":"sha256:7953eb3e3eed5dd708a4a1f2e894a9740c01bfcd6fbb7edb33386d899fcf1480","observation_id":"50ef9e93-dc16-4959-b069-f5a51622021d","resolution":{"observed_at":"2026-05-10T23:45:07.412275Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-24T12:33:37.701655Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2204.06745"},"observation_digest":"sha256:a0375d00d82d30a5726b85b3bc7f74b6a677a98b8f43cf9cdd04d128eafd0927","observation_id":"a486b441-112b-4452-a22c-c8f449738476","resolution":{"observed_at":"2026-05-24T12:34:28.453047Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2205.00445","last_updated":"2022-05-01T11:01:28Z","snapshot_observed_at":"2026-07-06T13:05:30.057038Z","submitted_at":"2022-05-01T11:01:28Z","title":"MRKL Systems: A modular, neuro-symbolic architecture that combines large language models, external knowledge sources and discrete reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T07:31:08.266737Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2205.00445"},"observation_digest":"sha256:d0cf20cb3de622d84949466c5f3ab17539fff3cf365fcec240502f678793711b","observation_id":"1b0f78c3-7254-406c-901b-7c0785a3cdbd","resolution":{"observed_at":"2026-05-15T07:31:08.360935Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":280,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:a48a066425a6a0fba37c32297a100ae25f26df6afd5018bb5b780ab828aa4638","observation_id":"c1aa1546-e474-4276-80dd-173584b680f7","resolution":{"observed_at":"2026-05-10T20:53:17.867906Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-07-06T13:13:18.623287Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-12T19:04:13.778347Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2205.11916"},"observation_digest":"sha256:9ecab5bd393e1cd736b531d35d001cf8ab2f398dcadb3ae9702c74afdbc31c32","observation_id":"ecb73857-13d3-4ed8-8a0d-c644e03c1c90","resolution":{"observed_at":"2026-05-12T19:04:13.821923Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2207.14255","last_updated":"2022-07-28T17:40:47Z","snapshot_observed_at":"2026-08-03T04:07:30.689454Z","submitted_at":"2022-07-28T17:40:47Z","title":"Efficient Training of Language Models to Fill in the Middle","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-18T00:40:41.647820Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2207.14255"},"observation_digest":"sha256:7ce3d1224769604da88296d06ad60ea4effa57abb9c39f7629ac3811d11e5379","observation_id":"cd4c12af-5bee-44b1-ba33-16490830667f","resolution":{"observed_at":"2026-05-18T00:40:41.818938Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-05T00:57:17.859949Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-16T13:48:43.024120Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2208.03299"},"observation_digest":"sha256:976e99754a9960255404b9c9e5f952da4ebb6e4989952b50724dd9b181b111d5","observation_id":"8231ca83-a3a7-4cac-92ed-93c06e062dbb","resolution":{"observed_at":"2026-05-16T13:48:43.160081Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-05T00:57:17.859949Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"reference_index":249,"source":"arxiv_source","source_observed_at":"2026-05-16T13:48:43.024120Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2208.03299"},"observation_digest":"sha256:58252d328ffaa22577d4f20dcbead412fec66c11162ce47ecb5c7594f22e4b98","observation_id":"099e2817-021f-4d81-bc17-e29e820820e7","resolution":{"observed_at":"2026-05-16T13:48:43.486276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-15T09:47:03.766814Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2209.05433"},"observation_digest":"sha256:10caabd8a129acad8a49d9dafc09fa1c94d3426719eb480f8ec31b6aa110967c","observation_id":"a29b721d-82b8-4ac6-aa87-a8b8a8b4a1f0","resolution":{"observed_at":"2026-05-15T09:47:03.818455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2211.12588","last_updated":"2023-10-23T01:27:38Z","snapshot_observed_at":"2026-08-02T13:06:11.850456Z","submitted_at":"2022-11-22T21:06:00Z","title":"Program of Thoughts Prompting: Disentangling Computation from Reasoning for Numerical Reasoning Tasks","version":4},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-12T16:48:27.918334Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2211.12588"},"observation_digest":"sha256:72be953d1e47e15b8ad80dec160790758195659dfbe881450852f122ca8b36f7","observation_id":"52037305-cac3-4fb5-b16d-67b0121c8f9f","resolution":{"observed_at":"2026-05-12T16:48:28.168142Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2303.17491","last_updated":"2023-11-16T20:15:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T16:01:52Z","title":"Language Models can Solve Computer Tasks","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-17T12:17:26.602361Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2303.17491"},"observation_digest":"sha256:20f66273130b41702e3b159e322df8160e7a838d4f927a92bc1399f6ea601630","observation_id":"63ab85ea-6a4e-4d41-a39b-2b6e521f4da2","resolution":{"observed_at":"2026-05-17T12:17:26.821735Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:6de838cbeb69053409ca0996250c3f6b5c78fecd58ff28816d9c5b71cf2a4270","observation_id":"19dcd158-70b9-47a3-9321-656e5ac5fbf9","resolution":{"observed_at":"2026-05-13T23:19:46.785310Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-06T18:34:53.559874Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":115,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:4958b11fe667790a73c5db138aa736375a12a88212e45f763ccd25bfde26f9e2","observation_id":"faad2191-00ce-4e8b-8718-803da0a818a0","resolution":{"observed_at":"2026-05-10T22:46:40.117344Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-15T17:45:17.540282Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2304.01373"},"observation_digest":"sha256:22109e8d4118a185ae0ae233ecd90a7c471be16be827d098ddeddbf3ed5e84e4","observation_id":"bf6ab664-31cc-48a9-9a6b-e8cee9a02e2b","resolution":{"observed_at":"2026-05-15T17:45:17.729178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2304.06767","last_updated":"2023-12-01T14:28:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T18:22:40Z","title":"RAFT: Reward rAnked FineTuning for Generative Foundation Model Alignment","version":4},"reference_index":112,"source":"arxiv_source","source_observed_at":"2026-05-18T00:46:56.664582Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2304.06767"},"observation_digest":"sha256:c452c1b84d9576cafe81ad75e3fdeb08a594e8041fd0dff5ff532e1bdc7c1c14","observation_id":"1d2bd2c8-6aed-4f51-814a-19248819316f","resolution":{"observed_at":"2026-05-18T00:46:56.769745Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T20:37:01.617345Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2304.10592"},"observation_digest":"sha256:d91338e80a98b76ad83ba4b9887c6739e174d1fac1466eaff95927c33b3ce4a5","observation_id":"09e1623f-97a6-4ca5-99fd-2cdfb366953a","resolution":{"observed_at":"2026-05-10T20:37:01.953355Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-21T20:50:09.265838Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2305.02301"},"observation_digest":"sha256:612c86db3ccb99e5bd6871b134e8f0e979cc5d0624153a3750792bc70eb25931","observation_id":"39312b7b-8b85-403a-82a7-e380fe41f8a8","resolution":{"observed_at":"2026-05-21T20:50:09.469443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:a927a2afd0fec3bb533c0526fe5e92e8ea1b48668c5fc2324a2e5c3f2c32ef3f","observation_id":"7f1f77ed-ed3c-49c1-b48b-820e49dda987","resolution":{"observed_at":"2026-05-10T23:33:00.632672Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:79895678a9a4ed41face358148486acac1a6adb5c362abd88c11a36a7bb274a9","observation_id":"3ed52d22-268b-4b83-91c8-185a940931b4","resolution":{"observed_at":"2026-05-18T01:35:21.363963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":117,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:b9cae83efa51e9cf48b604388c9ddb9ab0f868a80bc71000b746b7fd3ff84d79","observation_id":"559e2ffa-4344-4b44-8ed1-33d5930b0bf0","resolution":{"observed_at":"2026-05-19T20:28:39.395686Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2309.14509","last_updated":"2023-10-04T16:51:13Z","snapshot_observed_at":"2026-08-04T19:27:31.715261Z","submitted_at":"2023-09-25T20:15:57Z","title":"DeepSpeed Ulysses: System Optimizations for Enabling Training of Extreme Long Sequence Transformer Models","version":2},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-13T01:07:22.166595Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2309.14509"},"observation_digest":"sha256:69528b711f71abab074b20f4604efa75ca5d52c07277ccbed54eb74c816e9b3a","observation_id":"6174c909-ccf6-4d60-8777-767adc0c54d6","resolution":{"observed_at":"2026-05-13T01:07:22.310566Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-16T07:13:08.867745Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2310.09478"},"observation_digest":"sha256:b8aa72ab626db2ff2051ed0bcd61cf2843cc62e58765cb5bfe45ad181c961fde","observation_id":"9ebc7711-7d7b-4a73-9054-aa5224e22477","resolution":{"observed_at":"2026-05-16T07:13:08.963276Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:10087a63387840b6368d252e50e8373c22f0d1dd3a191ad2536e1f4521621ef2","observation_id":"6e875dfa-0357-496f-80de-72367519a446","resolution":{"observed_at":"2026-05-16T09:46:10.039408Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"reference_index":164,"source":"arxiv_source","source_observed_at":"2026-05-11T06:08:05.550346Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2401.02954"},"observation_digest":"sha256:8ee182aec569ceb05f0940007907323a2e123abead881c599c2ee561b72d9afb","observation_id":"a7a3a822-d535-4b32-8004-9a7c8f3e918d","resolution":{"observed_at":"2026-05-11T06:08:06.314335Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-11T15:22:54.023279Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2402.06196"},"observation_digest":"sha256:f58c0035c72b0b31e6990f21f338edcfd49d4a5bfe8405e994ef3a094808578a","observation_id":"ca5a0c81-b324-4ea3-b347-a8a154f6ebfe","resolution":{"observed_at":"2026-05-11T15:22:55.404021Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-05-11T05:36:26.207359Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2405.04434"},"observation_digest":"sha256:608700a3c5c35a1877e35e879d7248c08472aa2ee30f0b9753a44104f1eb46ab","observation_id":"7af723dd-e793-4bde-b21d-2bc5f83e8c60","resolution":{"observed_at":"2026-05-11T05:36:26.849180Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-05-13T15:51:29.022336Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2412.21187"},"observation_digest":"sha256:71e9f0af07f59be47ed7acd0c82117c0b5469dc6a88abf7b8fc831bf250ed06a","observation_id":"95d34cb4-cc34-4d1c-b590-c1067d1ebeb8","resolution":{"observed_at":"2026-05-13T15:51:29.509284Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2501.01046","last_updated":"2026-05-18T15:41:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-02T04:11:23Z","title":"SEDD: Scalable and Efficient Dataset Deduplication with GPUs","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-23T06:45:53.685914Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2501.01046"},"observation_digest":"sha256:ad6cb3e553a1cd3437c490d710868b1555b28e90f98ee35978c1d90ddad968c1","observation_id":"68750bdd-ab4f-4e91-b674-5265d232da8f","resolution":{"observed_at":"2026-05-23T06:47:39.580914Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:98623e4818f58e36ed865d50a67cb98b252bdc2236a456a3d9eb0c6591824f1d","observation_id":"4b54afb2-b5b9-488b-8db0-17fa88158b11","resolution":{"observed_at":"2026-05-16T06:26:38.632248Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2507.00432","last_updated":"2025-10-20T14:27:09Z","snapshot_observed_at":"2026-07-06T21:50:16.465983Z","submitted_at":"2025-07-01T05:23:05Z","title":"Does Math Reasoning Improve General LLM Capabilities? Understanding Transferability of LLM Reasoning","version":2},"reference_index":247,"source":"arxiv_source","source_observed_at":"2026-05-19T01:01:09.840919Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.00432"},"observation_digest":"sha256:9e713d19447969dc772300a504f66631dd96556ddd50a602a4e19d69b45e8131","observation_id":"d2031268-7be2-48ea-80f6-85d7535c0870","resolution":{"observed_at":"2026-05-19T01:01:10.436989Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T17:47:40.166161Z","title":"Using DeepSpeed and megatron to train megatron-turing NLG 530B, a large-scale generative language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.09955","last_updated":"2025-07-14T06:10:30Z","snapshot_observed_at":"2026-08-06T17:40:46.577608Z","submitted_at":"2025-07-14T06:10:30Z","title":"DeepSeek: Paradigm Shifts and Technical Evolution in Large AI Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-06T17:47:40.166161Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.09955"},"observation_digest":"sha256:4721c33d2287a10937e072063b8d2b3f7499f276b7e29ead2c2de8c8ddda59ac","observation_id":"3dfbd059-797e-47a7-b746-58c67c178a86","resolution":{"observed_at":"2026-08-06T17:47:40.166161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T17:56:44.086979Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.10613","last_updated":"2025-07-13T15:15:24Z","snapshot_observed_at":"2026-08-06T17:47:49.655656Z","submitted_at":"2025-07-13T15:15:24Z","title":"Sub-Scaling Laws: On the Role of Data Density and Training Strategies in LLMs","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T17:56:44.086979Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.10613"},"observation_digest":"sha256:e7d8b0d25117ad9d430fad9c24acfb0c59c6625e61ea48e7b65898a1f41b8b6a","observation_id":"a6a6043a-eade-40ba-ba08-eb963eda6965","resolution":{"observed_at":"2026-08-06T17:56:44.086979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T16:53:13.792040Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.12466","last_updated":"2025-07-16T17:59:45Z","snapshot_observed_at":"2026-08-06T16:42:43.163399Z","submitted_at":"2025-07-16T17:59:45Z","title":"Language Models Improve When Pretraining Data Matches Target Tasks","version":1},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-08-06T16:53:13.792040Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.12466"},"observation_digest":"sha256:fd1b10a584747044956754710a968f2dee62030ecabd00abd96f8e52e5ab16cf","observation_id":"8526b1fe-2dca-4403-8acc-9cf99df5dfa8","resolution":{"observed_at":"2026-08-06T16:53:13.792040Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-06T13:56:17.516037Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.20018","last_updated":"2025-07-29T05:18:46Z","snapshot_observed_at":"2026-08-06T13:56:10.452494Z","submitted_at":"2025-07-26T17:21:11Z","title":"The Carbon Cost of Conversation, Sustainability in the Age of Language Models","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-06T13:56:17.516037Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2507.20018"},"observation_digest":"sha256:092cfbbd0713b72cad3f762ad5630eccbf6edc34642b37cd99702cc29a0e702a","observation_id":"7ab3e7fe-6e51-40fb-9964-594166fb7d91","resolution":{"observed_at":"2026-08-06T13:56:17.516037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T17:55:07.250063Z","title":"Using deepspeed and megatron to train megatron-turing nlg 530b, a large-scale generative language model","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.15881","last_updated":"2025-08-25T02:24:20Z","snapshot_observed_at":"2026-08-05T17:55:04.790166Z","submitted_at":"2025-08-21T15:25:40Z","title":"TPLA: Tensor Parallel Latent Attention for Efficient Disaggregated Prefill and Decode Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T17:55:07.250063Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.15881"},"observation_digest":"sha256:a5ad4c5d15c53a1b2b7daf79b3c0f6040993273e59fd7e1ccb7a2142d032f84f","observation_id":"90d1014f-f333-4cb1-9c37-0284d893ebb7","resolution":{"observed_at":"2026-08-05T17:55:07.250063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2508.21613","last_updated":"2026-04-20T07:16:46Z","snapshot_observed_at":"2026-07-30T02:14:25.450050Z","submitted_at":"2025-08-29T13:22:11Z","title":"Chameleon: Adaptive Fault Tolerance for Distributed Training via Real-time Policy Selection","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-18T20:39:32.123038Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.21613"},"observation_digest":"sha256:bb261bebc7df59a03c7925fc7891a3d47531851db0d53ac6f882d6cc540f40e9","observation_id":"3356bce0-fe8f-4732-ac13-4893bee81912","resolution":{"observed_at":"2026-05-18T20:41:50.646394Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T14:12:37.071923Z","title":"Smith, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.21622","last_updated":"2025-08-29T13:34:55Z","snapshot_observed_at":"2026-08-06T17:05:12.765300Z","submitted_at":"2025-08-29T13:34:55Z","title":"Integrating Large Language Models with Network Optimization for Interactive and Explainable Supply Chain Planning: A Real-World Case Study","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T14:12:37.071923Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2508.21622"},"observation_digest":"sha256:cadcae3eb971ed5024af4169fc91d3c0a6f4cebd4967a7ddef65ef90b462f150","observation_id":"48c4c3d1-1bc5-4c7a-9ab4-81383c8a8a4c","resolution":{"observed_at":"2026-08-05T14:12:37.071923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T11:18:08.081946Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.03018","last_updated":"2025-09-03T04:49:20Z","snapshot_observed_at":"2026-08-05T11:18:03.181681Z","submitted_at":"2025-09-03T04:49:20Z","title":"Mycroft: Tracing Dependencies in Collective Communication Towards Reliable LLM Training","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-05T11:18:08.081946Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2509.03018"},"observation_digest":"sha256:614eb6c64b37dbab8084c0e7d7f387666b11602f3584267f8cefe53d1269ac0e","observation_id":"7ebde26c-f639-4595-bec5-41cf8ff961ba","resolution":{"observed_at":"2026-08-05T11:18:08.081946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-04T23:49:31.251317Z","title":"Using deepspeed and megatron to train megatron-turing NLG 530b, A large-scale generative language model,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06362","last_updated":"2025-09-08T06:23:09Z","snapshot_observed_at":"2026-08-04T23:49:27.705205Z","submitted_at":"2025-09-08T06:23:09Z","title":"MaaSO: SLO-aware Orchestration of Heterogeneous Model Instances for MaaS","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T23:49:31.251317Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2509.06362"},"observation_digest":"sha256:8fdeb976d45c8e5a455bec5ec84e6109dbbe7359e6b70a4f665c38931ace041b","observation_id":"1ce99e3c-fdb0-4d9b-a830-b1114f96a3b9","resolution":{"observed_at":"2026-08-04T23:49:31.251317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2509.07177","last_updated":"2026-04-14T15:07:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-09-08T19:48:52Z","title":"Towards EnergyGPT: A Large Language Model Specialized for the Energy Sector","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-18T17:39:17.456350Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2509.07177"},"observation_digest":"sha256:34e9842ee4cf2991c19895470bd0277b469b9537b3d9df0c3e8fc6a8070cebfe","observation_id":"f7e4b7d6-fc68-497d-a019-8808945a2ab6","resolution":{"observed_at":"2026-05-18T17:42:47.433805Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-03T11:25:09.565155Z","title":"Catanzaro, B","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.06649","last_updated":"2026-06-08T14:01:39Z","snapshot_observed_at":"2026-08-06T11:27:51.082340Z","submitted_at":"2026-01-10T18:24:40Z","title":"Revisiting Training Scale: An Empirical Study of Token Count, Power Consumption, and Parameter Efficiency","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T11:25:09.565155Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2601.06649"},"observation_digest":"sha256:ec890b9ea39e33348e83af7e79371005d38aa57c0ce558dc29b01357de098afa","observation_id":"92cb1cd5-ba43-4c9d-b888-2ead73b2ced4","resolution":{"observed_at":"2026-08-03T11:25:09.565155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2602.22437","last_updated":"2026-04-21T21:24:42Z","snapshot_observed_at":"2026-08-06T03:16:16.624191Z","submitted_at":"2026-02-25T21:55:43Z","title":"veScale-FSDP: Flexible and High-Performance FSDP at Scale","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-15T19:03:22.142671Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2602.22437"},"observation_digest":"sha256:89e291c28f1ebce3e78577f1e5d85a2e0c370b8993e8ff1b97a951f0ff674a5a","observation_id":"50005be3-08b2-4d3c-8d04-6b26200316c7","resolution":{"observed_at":"2026-05-15T19:06:30.823510Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2603.14360","last_updated":"2026-05-13T23:29:01Z","snapshot_observed_at":"2026-08-01T09:38:25.349230Z","submitted_at":"2026-03-15T12:53:09Z","title":"M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-15T11:35:43.088803Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2603.14360"},"observation_digest":"sha256:c7d52755d2f1e1ad4e1988ab6030fc7d612ed9aa39d2ac3060423cbf0021f222","observation_id":"9e152b6e-7278-46ae-af21-b87a2560c74c","resolution":{"observed_at":"2026-05-15T11:39:59.287357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2604.02473","last_updated":"2026-04-02T19:08:47Z","snapshot_observed_at":"2026-07-06T22:51:48.992363Z","submitted_at":"2026-04-02T19:08:47Z","title":"Analyzing Reverse Address Translation Overheads in Multi-GPU Scale-Up Pods","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-05-13T20:37:49.558450Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2604.02473"},"observation_digest":"sha256:26b7b89774472c5ca9ee516a098d6f6437344c905fd9a1b498773197b409f68c","observation_id":"9d979ed2-cb97-4d67-a004-6fafd0d4b770","resolution":{"observed_at":"2026-05-13T20:38:14.387153Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2604.13847","last_updated":"2026-04-23T20:25:54Z","snapshot_observed_at":"2026-08-03T01:25:08.797180Z","submitted_at":"2026-04-15T13:18:07Z","title":"SparseBalance: Load-Balanced Long Context Training with Dynamic Sparse Attention","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-10T13:51:03.591878Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2604.13847"},"observation_digest":"sha256:5c8f115a5156d359d38c073c8a9b15338811cc3b539eb0be1b77f4f5b781eebf","observation_id":"5ddb0c30-bb4e-4b90-924d-f362dcb321eb","resolution":{"observed_at":"2026-05-10T13:55:28.011720Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2604.24088","last_updated":"2026-04-27T06:27:31Z","snapshot_observed_at":"2026-07-29T22:55:04.073973Z","submitted_at":"2026-04-27T06:27:31Z","title":"TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-08T01:36:41.804171Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2604.24088"},"observation_digest":"sha256:dda56f6445db36be1a7ddaf10579cecc4e596cbc5c8c0c22ff929aee0f3825d2","observation_id":"2e41a25a-1204-4377-b17e-0fd4c0a8fa19","resolution":{"observed_at":"2026-05-11T23:06:20.780351Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.01938","last_updated":"2026-05-03T15:36:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-03T15:36:42Z","title":"Cross-Layer Energy Analysis of Multimodal Training on Grace Hopper Superchips","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-09T15:58:52.425995Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.01938"},"observation_digest":"sha256:c101d52cdfd74995e7d58d206c46abbef0503d02dc70b4322421dab1609b29fd","observation_id":"0b7d393b-f9b7-4505-92e8-b080fc17d68f","resolution":{"observed_at":"2026-05-09T21:58:47.272285Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.07726","last_updated":"2026-05-08T13:32:17Z","snapshot_observed_at":"2026-08-02T22:37:43.833182Z","submitted_at":"2026-05-08T13:32:17Z","title":"A Scalable Recipe on SuperMUC-NG Phase 2: Efficient Large-Scale Training of Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T02:21:17.841592Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.07726"},"observation_digest":"sha256:32522985d4b2f0be38dbb0b7f31b38daee32d317f6c18c8bbfac52a4d3f0b6fe","observation_id":"8d33e553-0885-4dc1-b5ee-8dcc54f613a9","resolution":{"observed_at":"2026-05-11T03:45:56.344897Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.08633","last_updated":"2026-05-09T02:57:16Z","snapshot_observed_at":"2026-08-02T10:46:06.614865Z","submitted_at":"2026-05-09T02:57:16Z","title":"Transforming the Use of Earth Observation Data: Exascale Training of a Generative Compression Model with Historical Priors for up to 10,000x Data Reduction","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-12T01:14:17.332353Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.08633"},"observation_digest":"sha256:8b37ea45f004a16ae5901c872de74579048ed29a530782baba03f5a453125d1d","observation_id":"9c53ad3d-384c-41fe-8417-da812e31e5ce","resolution":{"observed_at":"2026-05-12T08:21:24.088540Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.10391","last_updated":"2026-05-11T11:36:37Z","snapshot_observed_at":"2026-07-06T23:22:23.287792Z","submitted_at":"2026-05-11T11:36:37Z","title":"Phoenix-VL 1.5 Medium Technical Report","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T04:41:27.144815Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.10391"},"observation_digest":"sha256:70f7f1f4c1b478b67d189b4fe36c582b40b78737f2d8537c5c6e17f50ab170d9","observation_id":"f24b1559-05c5-411b-98ef-1bc7bf1b1f74","resolution":{"observed_at":"2026-05-12T06:01:24.844809Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.17164","last_updated":"2026-05-19T23:51:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-05-16T21:28:22Z","title":"Charon: A Unified and Fine-Grained Simulator for Large-Scale LLM Training and Inference","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-20T14:11:58.106397Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.17164"},"observation_digest":"sha256:f615000914d1a48c212c8a5dd948b18d8f847df593912d4d54c0495b622633ad","observation_id":"e19f136e-48f6-4eb9-8d69-e1d27dc92593","resolution":{"observed_at":"2026-05-20T14:13:21.224636Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.24981","last_updated":"2026-05-24T10:18:51Z","snapshot_observed_at":"2026-07-06T23:34:57.148983Z","submitted_at":"2026-05-24T10:18:51Z","title":"Large Language Model Selection with Limited Annotations","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-06-30T12:13:26.167487Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.24981"},"observation_digest":"sha256:fbfb5a57fc1132c95ef7dc2948fde9497c676f80eb7379679f0e801a5fcddf0d","observation_id":"529ce6db-d9d7-4fbf-a375-380928af73f6","resolution":{"observed_at":"2026-06-30T12:14:39.001090Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2605.27678","last_updated":"2026-05-26T20:53:06Z","snapshot_observed_at":"2026-08-02T04:49:53.019675Z","submitted_at":"2026-05-26T20:53:06Z","title":"Heterogeneous Parallelism for Multimodal Large Language Model Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T18:42:09.591282Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2605.27678"},"observation_digest":"sha256:a820b9d24817de1845590e81f150182e4049730928765a07837aae117c0b5944","observation_id":"16bc8f80-e4bd-46ec-bb85-73c17165dfd3","resolution":{"observed_at":"2026-06-29T18:43:50.407336Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2606.20691","last_updated":"2026-06-14T23:19:00Z","snapshot_observed_at":"2026-08-03T00:59:55.190938Z","submitted_at":"2026-06-14T23:19:00Z","title":"Specific Domain Ontology Construction Using Large Language Models","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-06-27T03:26:15.805999Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2606.20691"},"observation_digest":"sha256:2db9faeda2ab46c7da31f3f3f8daef3f95d05f78851404bd9b309d8922a48040","observation_id":"f451607f-3301-470c-b5c4-d2f56466ada0","resolution":{"observed_at":"2026-07-03T17:58:47.538594Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":"2201.11990","doi":"10.48550/arxiv.2201.11990","metadata_source":"pith","pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","venue":"cs.CL","work_id":"7db569c6-f66a-40a1-9974-3de1eb611cc1","year":2022},"citing_paper":{"arxiv_id":"2607.07862","last_updated":"2026-07-08T18:54:08Z","snapshot_observed_at":"2026-08-02T18:07:48.851195Z","submitted_at":"2026-07-08T18:54:08Z","title":"CTA-Pipelining: A Latency-Oriented Spatial Scaling Method for Multi-GPU Systems","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-10T16:30:09.561233Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2607.07862"},"observation_digest":"sha256:05e3ed4aa26ff74cde7590d12162439aa14174e540530d7cac780fd2225ddfc3","observation_id":"41110de5-87f0-4039-b6f1-6564292b6913","resolution":{"observed_at":"2026-07-10T16:37:23.050768Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-02T13:37:00.195526Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21610","last_updated":"2026-05-20T04:43:02Z","snapshot_observed_at":"2026-08-06T13:09:35.487490Z","submitted_at":"2026-05-20T04:43:02Z","title":"SCOPE and SCION: A Benchmark and an Auditable Reference Pipeline for Schema Induction and Fusion from Text","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-02T13:37:00.195526Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2607.21610"},"observation_digest":"sha256:77c2be314c467eead54c7976eb425d86320a5a65fc014c7122cfb63a12f30670","observation_id":"dae08bfb-ab49-4177-b12c-1d65d6e46998","resolution":{"observed_at":"2026-08-02T13:37:00.195526Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-01T06:48:52.175260Z","title":"arXiv preprint arXiv:2201.11990 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.21793","last_updated":"2026-07-23T20:20:56Z","snapshot_observed_at":"2026-08-05T04:38:14.706947Z","submitted_at":"2026-07-23T20:20:56Z","title":"QLPO: Quadrant-weighted Sampling for Length-aware Policy Optimization","version":1},"reference_index":248,"source":"arxiv_source","source_observed_at":"2026-08-01T06:48:52.175260Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2607.21793"},"observation_digest":"sha256:9934b55d822f0e468e239ded226c91fac941c1766054c7016da5d8785eb3f7ca","observation_id":"2504b164-29fb-4361-bbf5-ae4a643ac76f","resolution":{"observed_at":"2026-08-01T06:48:52.175260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2201.11990/citation-record","integrity":"/paper/2201.11990/integrity","json":"/paper/2201.11990/citation-record.json","paper":"/paper/2201.11990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.nvidia.com/en-us/data-center/a100/","venue":null,"work_id":"9aba6afd-1069-41ef-a554-c02e82a70490","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4e9e462cdaa7db62ae25a73caa34ee12e72ca63adc0bb9092277134b644554f9","observation_id":"c4a63d83-df42-47fd-aedc-fa7568234c1f","resolution":{"observed_at":"2026-05-24T12:14:28.214658Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.top500.org/system/179842/","venue":null,"work_id":"1ebd4d31-4b8c-4a97-b012-e19e5ffad1a2","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:887a0024bbe00b2603815dc9da972fbb75ff278d6b87e3ed592ea2e02e81d873","observation_id":"4ddbc2dc-1fce-44b4-8cee-8c4ab5c08f44","resolution":{"observed_at":"2026-05-24T12:16:11.674946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.nvidia.com/en-us/data-center/nvlink/","venue":null,"work_id":"a8f6e420-5811-4668-b2cb-c99f81b3e06a","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:5b637081e34aa3b1ca88a9849b4f610b68218b7186428727b27e257dd79d1478","observation_id":"5683aae2-8d70-469f-b2cf-48b660dc388c","resolution":{"observed_at":"2026-05-24T12:16:11.652197Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://www.microsoft.com/en-us/research/blog/ turing-nlg-a-17-billion-parameter-language-model-by-microsoft/","venue":null,"work_id":"2d3b6316-0375-4ca7-ae58-964e4361bb48","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:a80bb204db7725e2258cccacaebfc3923d225c4ca6bcc121d7a735414dcbc175","observation_id":"ec0bffb2-6f4a-440d-9eb8-f509b0b8dfff","resolution":{"observed_at":"2026-05-24T12:16:11.623132Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"https://wudaoai.cn/home","venue":null,"work_id":"e808fab1-ae10-4768-9db5-2cf1cbffb649","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:b216dfd4231c22e97a158a8d52529befe6d6e648a6c38a15896e7a83c97551c0","observation_id":"ad2fdb52-dd7d-4acc-a816-91e5e9f271bb","resolution":{"observed_at":"2026-05-24T12:16:11.632939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"c23e3e5d-7712-4be6-9fe1-cdb0439be536","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:f0711832e0d9f90bd08e263c81bb62f747ab8221cdfc0892497230559248ada3","observation_id":"5301a898-11bc-4d8e-bede-e78fe10659a5","resolution":{"observed_at":"2026-05-24T12:16:11.615814Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zou, Venkatesh Saligrama, and Adam Tauman Kalai","venue":null,"work_id":"75343b50-23b0-4685-a8e2-f6f49c83d39f","year":2016},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:790a96648e2a39e4ccaff9af26881665b6f69d0072c37541aee184849e2c72ce","observation_id":"061dbb82-7aa5-433c-b3c6-f8ce0a0c28f4","resolution":{"observed_at":"2026-05-24T12:16:11.711307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":"2108.07258","doi":"10.1016/j.specom.2008.12.003","metadata_source":"pith","pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"On the Opportunities and Risks of Foundation Models","venue":"cs.LG","work_id":"a18039e9-928d-47c9-a836-32656a71bf71","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:ed0653dd17cedd228e5ae95ed9eb25b601fb00451ca62ec2a6166470957853fe","observation_id":"c3e9e4bd-8b95-4171-85e9-f3bfb7104923","resolution":{"observed_at":"2026-05-24T12:14:26.642555Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T09:22:59.787075+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d6e93b65-5aaf-451d-bf27-7a8be4ad7617","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:5435d4c223abc7530cfbe2e1d1c0ac27b322aac6b4aa334366510f199dab53d5","observation_id":"38e91e00-9566-4234-95cd-2e52230dc9e2","resolution":{"observed_at":"2026-05-24T12:16:11.701886Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BoolQ: Exploring the surprising difﬁculty of natural yes/no questions","venue":null,"work_id":"b951dbea-6ca4-42fd-af8e-e894f7ae2f0a","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:9dc49017a50a72d027022dbeda9b2be3b249ee607f9c34dec202102232e1c9a9","observation_id":"40fc54e9-1170-48a4-99a6-4c7894c4bedf","resolution":{"observed_at":"2026-05-24T12:16:11.699086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"langdetect","venue":null,"work_id":"337a9c67-0f51-4ef9-8e7c-2ce4e865a95c","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:1fa608f62d424b5237623d18ec8da79d8c95066219f00d991e6173a50fdb5569","observation_id":"0b3b913b-a9c5-48f8-8f97-1a96a0bc2af1","resolution":{"observed_at":"2026-05-24T12:16:11.695843Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"92b7a323-898e-4830-841a-b6cc4af5485d","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:c22aec5df0378a9462a41aa2fd35c9e126768b990b79c9e5038a0e445d2d9796","observation_id":"97094877-c5db-418b-9804-aba9314b625d","resolution":{"observed_at":"2026-05-24T12:16:11.692449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language and Gender","venue":null,"work_id":"9517d1ce-2f7d-47e7-9b7b-7d7ac93d8b43","year":2003},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:118897cb0b75fbf126f63fdf57900ec9ad8074d39e867e012573f6f5d8597353","observation_id":"6bedb14c-37e8-4b98-9fc1-23b6561965bf","resolution":{"observed_at":"2026-05-24T12:16:11.685180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.05367","last_updated":"2023-06-30T14:52:42Z","snapshot_observed_at":"2026-07-06T11:56:37.658013Z","submitted_at":"2021-10-11T15:52:16Z","title":"Improving Gender Fairness of Pre-Trained Language Models without Catastrophic Forgetting","version":3},"cited_work":{"arxiv_id":"2110.05367","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.05367","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving gender fairness of pre-trained language models without catastrophic forgetting","venue":null,"work_id":"0d63635e-c72c-42b9-8a92-5c693e2756fe","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2110.05367","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:cd58e1890edc65800984aeb91dcc4038840a7595b227366823e500965b10bcbe","observation_id":"0a2cab10-6e8a-4661-aaeb-31438aa8795f","resolution":{"observed_at":"2026-05-24T12:14:26.529058Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":"2101.03961","doi":"10.1214/18-ejs1395","metadata_source":"pith","pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":"cs.LG","work_id":"f43c4955-a965-4897-a11b-c4b25d2aeaa8","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:aee6ffd0308713f4910b0c8c4858047268fffec5e848214ccbe51bfd9ac30f48","observation_id":"188c7c7c-c2a4-4ac2-963e-06c2c914aecc","resolution":{"observed_at":"2026-05-24T12:14:26.554412Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ab8721f1-e056-470f-b0c3-43fa93e15e0e","year":1978},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:6b0af8b774e5aacbf6bab651466303c06e82149d88132b02c57916f716762074","observation_id":"bf493b06-6eb2-490c-9a52-ed8b034d707e","resolution":{"observed_at":"2026-05-24T12:16:11.678098Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4879068cf322be555c0b7c7030e8c6ffc475beb800921afddeb968c083a05619","observation_id":"95c74833-2394-4f52-9d56-76c3bd30f954","resolution":{"observed_at":"2026-05-24T12:14:26.617941Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A framework for few-shot language model evaluation, September 2021","venue":null,"work_id":"35ac2e6a-caa8-4065-9eb5-5c0e3d3fd2c9","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:65667d28a53443ca7e0c4887836e89de909f821db8961f40f4502bf607eb9285","observation_id":"341446bc-7976-4cf0-a74f-82c12d1ad3f3","resolution":{"observed_at":"2026-05-24T12:16:11.681607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Realtoxici- typrompts: Evaluating neural toxic degeneration in language models","venue":null,"work_id":"45a79b0a-65fe-4a56-aa7e-6a6364e72895","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:b8687c1425ab17f4b63f0a49f37455d49ccbcc446cf6d9139b68d56b6d1b0563","observation_id":"453a68ec-41cd-486a-8e1f-f183bea12a38","resolution":{"observed_at":"2026-05-24T12:16:11.666278Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ff87c10d-dda0-48af-a6d2-13b143458f64","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:64a084209110cb59163d835c8b10b13bb0ba3c04f29721b6a92d794d6cf2372f","observation_id":"231f2458-a0c7-4cc1-8d17-84179d2b88ee","resolution":{"observed_at":"2026-05-24T12:16:11.669759Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman, and Noah A","venue":null,"work_id":"137dd33f-5f28-4457-b45c-12ef1db8439a","year":2018},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4813ec563d50a11c2f4ceb243171c784d916b3bda9dfcd69db3ddfe48d9e1017","observation_id":"81fc2180-f439-4102-b57d-87094c398071","resolution":{"observed_at":"2026-05-24T12:16:11.612862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pretrained transformers improve out-of-distribution robustness","venue":null,"work_id":"798a65dd-0aad-4cb8-9093-91d018c05515","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:b8dc6fa12657457ef3fa552bf6992d4c12ee6b6e00121f2282381b37138b658b","observation_id":"9ee7a11c-92cf-48bd-8e3d-fb43f4301d09","resolution":{"observed_at":"2026-05-24T12:16:11.655722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gpipe: Efﬁcient training of giant neural networks using pipeline parallelism","venue":null,"work_id":"3028beae-e5d1-402f-a921-190b6e6366e8","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:c457335c43f2be98c7f119b8b20605d2bda1a3e747e92e948140f530b8a09ca2","observation_id":"3cd25986-83c6-45e4-a23e-a24a8d18f49b","resolution":{"observed_at":"2026-05-24T12:16:11.618954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.03292","last_updated":"2020-11-17T06:26:33Z","snapshot_observed_at":"2026-07-06T10:12:15.441352Z","submitted_at":"2020-11-06T11:33:29Z","title":"Improving Machine Reading Comprehension with Single-choice Decision and Transfer Learning","version":2},"cited_work":{"arxiv_id":"2011.03292","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2011.03292","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Improving machine reading comprehension with single-choice decision and transfer learning","venue":null,"work_id":"0616f0a5-c03c-47a2-b935-872ad8c48852","year":2011},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2011.03292","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:94b89acc3075ed30c3898ab1f42a928bffb0175abad39691df182f67456593f1","observation_id":"a6dcb3a6-f388-4e35-99d4-376a46e86c7a","resolution":{"observed_at":"2026-05-24T12:14:26.548306Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weld, and Luke Zettlemoyer","venue":null,"work_id":"31a07129-bb58-4827-9aaf-1ed0252f9577","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4923e07e5ebbaf6c34aa0bf63917b47b0d77a1674cf10191a78b8f285fd48ab1","observation_id":"a077427a-6faf-4744-8c8f-9acfd78bdd1c","resolution":{"observed_at":"2026-05-24T12:16:11.629590Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-07-06T04:45:24.152472Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:5c4a4ff6935a0f6eb6a17aed4565709f872d8e78f45adc5e89f486f3ac8454af","observation_id":"6e4ad3f1-64b6-4807-a5da-19b94718b99b","resolution":{"observed_at":"2026-05-24T12:14:26.671198Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:6b1f873235bd9c08f6f8269bd7e1ae6f02e3ef65e8d325925c0bfef876a6fd6c","observation_id":"2f0e1829-96f9-43e7-8f7c-2136f1f5e30d","resolution":{"observed_at":"2026-05-24T12:14:26.590744Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gedi: Generative discriminator guided sequence generation","venue":null,"work_id":"1a518590-6da5-48cf-a4dc-caa00ace7359","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:fb3669a65dfc0b4fc92b40d5c2b64f14b5f316b41e0a1f4716abaa2e8594e79f","observation_id":"1f4ce556-5d82-4d5b-ab90-36152535f120","resolution":{"observed_at":"2026-05-24T12:16:11.638662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dense-captioning events in videos","venue":null,"work_id":"5311feb8-b131-4568-a486-bb00f8946197","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:19d6127f14ddef67f46f6c3cf377d30f278b9eecdb3e31f782d273ad8ca62d37","observation_id":"086efc00-3fc5-40d9-a52c-5b1a0567564b","resolution":{"observed_at":"2026-05-24T12:16:11.626484Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Dai, Jakob Uszkoreit, Quoc Le, and Slav Petrov","venue":null,"work_id":"aa79dd20-0a08-4b0b-9372-5b2cb34bb49e","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:86194c37ec57b51a23c4fa5c3b1a2826ce960b537e844a509e42c5e2d17fccf7","observation_id":"dcf2d155-6709-455d-a93f-61efb86e1fba","resolution":{"observed_at":"2026-05-24T12:16:11.642577Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"RACE: Large-scale ReAd- ing comprehension dataset from examinations","venue":null,"work_id":"506686b8-fb6c-4a36-adc8-69200b2914f8","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:d103865b97a46c3027a472dbd6d2e6b4133a084a690f9fbc78a9e02695ee566d","observation_id":"94744b36-ea3e-4f7c-91b4-7485e170bee5","resolution":{"observed_at":"2026-05-24T12:16:11.648792Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-07-06T09:33:58.857566Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":"2006.16668","doi":"10.48550/arxiv.2006.16668","metadata_source":"pith","pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","venue":"cs.CL","work_id":"52b3c9a6-2a27-45a7-ba2b-ebe4b5bb5a5f","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:bf97b910d06b909dc0b6ebb1d23a2130bc368135727f59fbf2e6717ff970a931","observation_id":"7e4d6e39-99c8-4864-8525-f548a01cda0d","resolution":{"observed_at":"2026-05-24T12:14:26.566178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-06T15:24:34.790850Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":"2104.08691","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-07-04T14:59:55.372222Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","venue":"cs.CL","work_id":"1056ba8e-7b3f-4811-be8e-9a3ed9269acb","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:23a5151205f7205fd87f7eb4db1a66021f83c9a1db14f65ca5b8edaf8d68007a","observation_id":"d3b7ae9c-cd6d-447f-87fd-05b91b1129f0","resolution":{"observed_at":"2026-05-24T12:14:26.637272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jurassic-1: Technical details and evaluation","venue":null,"work_id":"feca390d-6e9e-4346-b64b-27d2f141895e","year":null},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4716041b6b5714fa246f6051d6be4152faca88364a0802ba660ff990277b0216","observation_id":"553acc1b-489e-4991-afe9-96627f8d4c91","resolution":{"observed_at":"2026-05-24T12:16:11.659837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00823","last_updated":"2021-05-29T09:16:05Z","snapshot_observed_at":"2026-08-06T11:42:26.440045Z","submitted_at":"2021-03-01T07:46:27Z","title":"M6: A Chinese Multimodal Pretrainer","version":4},"cited_work":{"arxiv_id":"2103.00823","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.00823","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, Jianwei Zhang, Xu Zou, Zhikang Li, Xiao Qing Deng, Jie Liu, Jinbao Xue, Huiling Zhou, Jianxin Ma, Jin Yu, Yonghong Li, Wei Lin, Jingren Zhou, J ie Tang, and Hongxia Yang","venue":null,"work_id":"3b06aecf-f122-4cde-85a8-30e7adf547b3","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2103.00823","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:72e9f4571f74ce9b05c4390489f94d207063ee5368515f7611b1f59bf7b23f7c","observation_id":"3f8851c0-dbbc-416f-9e39-fb38c754b508","resolution":{"observed_at":"2026-05-24T12:14:26.631436Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M6-10t: A sharing-delinking paradigm for efﬁcient multi-trillion parameter pretraining","venue":null,"work_id":"0ea0bcb9-340e-4ed7-97ad-d7283011a9dd","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:34c8f1e447f099dd9d6b7a893f0d4a5f10f62d29795d85056af17fdff3c1b10e","observation_id":"8a6709e2-8ed1-478c-90d0-66943b39cc94","resolution":{"observed_at":"2026-05-24T12:16:11.663013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:b7a10d7bd92c8fbdc78f2703977014790d23fd890053f32e7ddde966591c728e","observation_id":"4eb41430-3e27-4438-a046-df04adb8ab8e","resolution":{"observed_at":"2026-05-24T12:14:26.713341Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Unicorn on rainbow: A universal commonsense reasoning model on a new multitask benchmark","venue":null,"work_id":"93c8fc34-68df-4329-a884-3fcea9ab2780","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:57a7922df4e39da9f910e8cda732bc19cfa961b25e3d43ba5b82325e9dacacc9","observation_id":"5092cdbb-bd20-43ab-8fd5-6bf253f1598e","resolution":{"observed_at":"2026-05-24T12:16:11.609969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Black is to criminal as cau- casian is to police: Detecting and removing multiclass bias in word embeddings","venue":null,"work_id":"de421192-6a6a-4247-b65e-3bcc6bf21514","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:f017c57c9f732227983233d6e6bd17d6d8d7eaa310d406dc09dd1c4795709f55","observation_id":"5bc79588-2db3-4cdc-8f64-e82e16247f79","resolution":{"observed_at":"2026-05-24T12:16:11.609179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Right for the wrong reasons: Diagnosing syntactic heuris- tics in natural language inference","venue":null,"work_id":"f92e9991-b452-4449-9390-86a5a69dd9e8","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:eefa153cdf71a190c77b32103d8326db0b240d9ab3eceba14cf43fd11840b65b","observation_id":"347773d3-4b81-4e67-a5de-1a5419679380","resolution":{"observed_at":"2026-05-24T12:16:11.602015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:d2d4a9ac1383dcf94d7192ed499f06848d592151cba4338364df96654aa9a345","observation_id":"1a9df28b-c310-4be6-a43c-706ca4c966dc","resolution":{"observed_at":"2026-05-24T12:14:26.665627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pipedream: generalized pipeline parallelism for dnn training","venue":null,"work_id":"1a4ed885-a6e6-4afc-9139-d6b7d600084e","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:663eced32b2acaa43bc0bc1833e08019544be83edc9718371f1bda040503ecdd","observation_id":"0751dc8d-27f2-4f36-8e07-e6b601f4b40c","resolution":{"observed_at":"2026-05-24T12:16:11.708368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04473","last_updated":"2021-08-23T19:41:13Z","snapshot_observed_at":"2026-08-06T11:27:18.084971Z","submitted_at":"2021-04-09T16:43:11Z","title":"Efficient Large-Scale Language Model Training on GPU Clusters Using Megatron-LM","version":5},"cited_work":{"arxiv_id":"2104.04473","doi":"10.48550/arxiv.2104.04473","metadata_source":"pith","pith_arxiv_id":"2104.04473","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Efﬁcient large-scale language model training on gpu clusters using megatron-lm","venue":"cs.CL","work_id":"cb405716-f30a-4004-aef0-12f4f12f0e20","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2104.04473","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:83a19689434ef6c88478b63f10d7e0ad2ed453d34afa5df4797f180e3a2fc664","observation_id":"a4d62a99-e85b-4e0d-86d5-17278d726ffe","resolution":{"observed_at":"2026-05-24T12:14:26.541851Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.133437+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07790","last_updated":"2021-11-28T01:32:21Z","snapshot_observed_at":"2026-07-06T11:39:02.960140Z","submitted_at":"2021-08-04T22:18:10Z","title":"Mitigating harm in language models with conditional-likelihood filtration","version":3},"cited_work":{"arxiv_id":"2108.07790","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2108.07790","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mitigating harm in language models with conditional-likelihood ﬁltration","venue":null,"work_id":"fc86b9e4-a50c-4b4b-91da-ed67e6735249","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2108.07790","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:aabb275c867fa496a57a4e61b921dcb237eb1f8e707fd876e9ff855768cc209b","observation_id":"171e47ce-a5d5-4175-8455-3b458f4b96e8","resolution":{"observed_at":"2026-05-24T12:14:26.660621Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05895","last_updated":"2019-12-30T03:53:04Z","snapshot_observed_at":"2026-07-06T08:29:10.516150Z","submitted_at":"2019-10-14T02:23:43Z","title":"Transformers without Tears: Improving the Normalization of Self-Attention","version":2},"cited_work":{"arxiv_id":"1910.05895","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.05895","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nguyen and Julian Salazar","venue":null,"work_id":"1d2ca339-f1d0-44fb-9eb7-6fe898a9891f","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1910.05895","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:c5fa45d003d9a40065e70be5995731492c1faa081e802b95e0024dbc11e62b94","observation_id":"b62bf687-faa3-4741-ba03-c1d63af740f4","resolution":{"observed_at":"2026-05-24T12:14:26.535552Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.14599","last_updated":"2020-05-06T17:01:56Z","snapshot_observed_at":"2026-08-06T16:34:26.983423Z","submitted_at":"2019-10-31T16:50:43Z","title":"Adversarial NLI: A New Benchmark for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"1910.14599","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.14599","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial nli: A new benchmark for natural language understanding","venue":null,"work_id":"f8e4d908-62b2-4da1-a8f6-92a2a00fe7bc","year":1910},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1910.14599","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:4f9db5ccdc4d36e877b24b422a6a4a93f04396e33e72d06772e778c2b48d82ac","observation_id":"f5747286-3a03-4bc4-8303-b01f73c50a65","resolution":{"observed_at":"2026-05-24T12:14:26.572461Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Adversarial NLI: A new benchmark for natural language understanding","venue":null,"work_id":"dc60c421-2fec-41cb-a085-2fb44642bd7f","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:39938d51defdd8ad76f0fcd92ba55441bf372289f72730adb60a32ea061698a9","observation_id":"ae6b4f09-0d1d-4406-8aa4-beb6478167e7","resolution":{"observed_at":"2026-05-24T12:16:11.705336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asynchronous Pipeline for Processing Huge Corpora on Medium to Low Resource Infrastructures","venue":null,"work_id":"49126631-7476-4c26-825a-4254ab3ff9cb","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:aef3533b8476da761024a4528197f2dfc0bad256270aeeed390f31bf97afbbd0","observation_id":"37000ecf-05fd-42dd-8bd6-cad015d9c07b","resolution":{"observed_at":"2026-05-24T12:14:28.265669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The LAMBADA dataset: Word prediction requiring a broad discourse context","venue":null,"work_id":"9d0d46cf-8576-4cfd-a1be-dafcc641c364","year":2016},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:ec25de0c48906d594071fcc48e6dcce8af4ca5f4dae96084c65e41a93cb98c51","observation_id":"93a0fac9-b3a5-4b67-98ca-e34f5830cb80","resolution":{"observed_at":"2026-05-24T12:14:28.261856Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wic: the word-in-context dataset for evalu- ating context-sensitive meaning representations","venue":null,"work_id":"2da034c4-74da-4909-ab74-db14f46135a6","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:b6b877f9debe9c22f1f7fb2422fe51beaccef09cd4b7e19e9aa0926bc64eecd5","observation_id":"30d48419-ff8a-4163-a22b-5f828b5a9e04","resolution":{"observed_at":"2026-05-24T12:14:28.257883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Sentiwordnet","venue":null,"work_id":"7d52affe-5050-40bb-93ac-c26a1fae7954","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:47c2f5c891f8155069c28d0489373f3f692ef372dfda41d7b69277b4115e6024","observation_id":"e53022d9-3366-426c-8955-983383eb12fa","resolution":{"observed_at":"2026-05-24T12:14:28.253471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":"d32fd3de-b200-47e1-823f-c47e9019f299","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:06ef120259222907c83dde0b4c1096e9cb1d6146354d006710eee48880a2fc55","observation_id":"1307093c-0a35-483f-9cdf-d657d3999aab","resolution":{"observed_at":"2026-05-24T12:14:28.249270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c4b9c77f-1ac6-4faf-a53b-2f68ff69dbd7","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:f624e2fc6b58914bff26e1f49a0c983688c08fd3f1e4829382daafc956f3fbbb","observation_id":"27b1282f-8fbe-4c2b-96f1-7128dba985ad","resolution":{"observed_at":"2026-05-24T12:14:28.244481Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.10683","last_updated":"2023-09-19T15:14:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-10-23T17:37:36Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","version":4},"cited_work":{"arxiv_id":"1910.10683","doi":"10.18653/v1/2020.acl-main.259","metadata_source":"pith","pith_arxiv_id":"1910.10683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Transfer Learning with a Unified Text-to-Text Transformer","venue":"cs.LG","work_id":"50e3b368-0243-4726-8186-233869802ad1","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1910.10683","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:1f66e76e52c7511ebaecb72e43c0e8cf5a1a03fc564ed0858506279d2af1a5b3","observation_id":"c9ac42dd-898d-42f7-8216-4503ac9d465f","resolution":{"observed_at":"2026-05-24T12:14:26.516228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zero: Memory optimizations toward training trillion parameter models","venue":null,"work_id":"a11b4a0d-2e19-490b-9f47-46b2225d321d","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:38db417fb820919383630da2ffffdaa48559d0527868bfc15d5eb5d9e537b63e","observation_id":"5e5972b9-1778-4b5a-a8c5-5f7a752eb030","resolution":{"observed_at":"2026-05-24T12:14:28.240753Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07857","last_updated":"2021-04-16T02:22:12Z","snapshot_observed_at":"2026-07-06T11:00:07.753513Z","submitted_at":"2021-04-16T02:22:12Z","title":"ZeRO-Infinity: Breaking the GPU Memory Wall for Extreme Scale Deep Learning","version":1},"cited_work":{"arxiv_id":"2104.07857","doi":"10.48550/arxiv.2104.07857","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07857","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Zero-inﬁnity: Breaking the gpu memory wall for extreme scale deep learning","venue":"arXiv (Cornell University)","work_id":"4546e09d-ef90-46df-b6f2-7a3849a53009","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2104.07857","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:7216d403f01dd74691bd53db6f299900f4d7051a2e029f843b2707f8be7c1736","observation_id":"47c79d72-47c9-41b2-83e8-d4f6d4285e35","resolution":{"observed_at":"2026-05-24T12:14:26.603797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deepspeed: System optimiza- tions enable training deep learning models with over 100 billion parameters","venue":null,"work_id":"0b55904f-58bd-4490-97e5-b650a3877279","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:6238ed9a8ef65c8e303791d212316d429d650ad26d32b752f35c23937cade49a","observation_id":"316adef9-851c-42ba-a34e-58244a5fe2ab","resolution":{"observed_at":"2026-05-24T12:14:28.236509Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Winogrande: An adver- sarial winograd schema challenge at scale","venue":null,"work_id":"5f79cb71-f130-4964-8db4-c05535ac76c9","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:e0544d726cc51d088c9849510258f31bf4d4c49ff8b50021af070b49187b63eb","observation_id":"7f9cbea4-faac-407d-a3eb-90e30057f7dd","resolution":{"observed_at":"2026-05-24T12:14:28.230869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":"2110.08207","doi":"10.48550/arxiv.2110.08207","metadata_source":"pith","pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","venue":"cs.LG","work_id":"1857c952-db2f-4810-9e3c-27a862c8d276","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:f0600a62e090fdfa40b7773ee4118d09298ef074cad7ec274968144a9499da28","observation_id":"743884ad-3549-4c40-858f-14df0c2a1ed7","resolution":{"observed_at":"2026-05-24T12:14:26.597618Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.00453","last_updated":"2021-09-09T14:45:48Z","snapshot_observed_at":"2026-08-03T18:42:02.632123Z","submitted_at":"2021-02-28T11:07:37Z","title":"Self-Diagnosis and Self-Debiasing: A Proposal for Reducing Corpus-Based Bias in NLP","version":2},"cited_work":{"arxiv_id":"2103.00453","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2103.00453","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-diagnosis and self-debiasing: A proposal for reducing corpus-based bias in nlp","venue":null,"work_id":"76c79b2a-1d6b-4a1b-93d1-7b6c00de4f25","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2103.00453","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:037fbd5d98e722c870a4394881e34e1d3d2a837e117a43f3d0ace3b2fb223998","observation_id":"c478c972-aa07-4af8-a28f-a2ed657972ba","resolution":{"observed_at":"2026-05-24T12:14:26.584905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":"1701.06538","doi":"10.48550/arxiv.1701.06538","metadata_source":"pith","pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","venue":"cs.LG","work_id":"2c6b3f6d-54e4-4df7-baa7-475a490799af","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:09525c030d1b7269a5710f93a37f9e0c983463fb09555e774912c3a23bda0563","observation_id":"20423737-5423-46f1-8b2a-9bb7f7a3ffc8","resolution":{"observed_at":"2026-05-24T12:14:26.578410Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T08:08:24.174744+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The woman worked as a babysitter: On biases in language generation","venue":null,"work_id":"96142264-bf39-4364-98e6-8135d4010687","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:240687e6498a1a080b650ac8d751b27d49e2de54333dc518b509e1a641e42925","observation_id":"627d563c-aaa2-40af-a782-20c3e82b85c1","resolution":{"observed_at":"2026-05-24T12:14:28.226417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:3fbb6b05c16044a27ee8f13ecec48190c20d203cd58e884617cab0af619b2ff7","observation_id":"223dae09-93cc-48c5-a3ea-bd3020d8071e","resolution":{"observed_at":"2026-05-24T12:14:26.694969Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"129aec46-0a8d-41f2-a306-5456a8a1b6cc","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:139b3375c23ca0581a7192fe28c5670663c039e77d6afaeb48a3b408e2195b90","observation_id":"51722e09-3ae3-4119-bcde-b368d00c03c6","resolution":{"observed_at":"2026-05-24T12:14:28.222473Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"DeepSpeed","venue":null,"work_id":"52cfb21a-a426-49e1-9fd7-a5ae7313202f","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:d33a6bdc39e201d5ab2a0e006b319ce7db4b6db3a60bb4bcabd58ed0c01ee3a1","observation_id":"9fbf2154-9722-4172-8a71-144dceb3d283","resolution":{"observed_at":"2026-05-24T12:14:28.218694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.02847","last_updated":"2019-09-26T22:33:06Z","snapshot_observed_at":"2026-07-06T06:43:37.618154Z","submitted_at":"2018-06-07T18:13:08Z","title":"A Simple Method for Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":"1806.02847","doi":"10.48550/arxiv.1806.02847","metadata_source":"arxiv_reference","pith_arxiv_id":"1806.02847","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trinh and Quoc V","venue":"arXiv (Cornell University)","work_id":"a8423cfc-3f91-4307-9c05-02cfd6a0c714","year":2018},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1806.02847","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:05ea7094d311288a7cd242954f11068a970903667308011c247f4cbc0fdc798c","observation_id":"6cc1852f-d374-463e-924c-5a52840607e3","resolution":{"observed_at":"2026-05-24T12:14:26.560624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":"1706.03762","doi":"10.1186/s13550-021-00830-6","metadata_source":"pith","pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Attention Is All You Need","venue":"cs.CL","work_id":"baafb5a2-5272-43bc-932f-09fa9ffe5316","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:8c74c375e17ea3ac696a75dd44c721996ef7b0c969357c3ae5fb8c2aa40cc61b","observation_id":"1d6fef71-9e00-4580-be9f-9e29bd36edcc","resolution":{"observed_at":"2026-05-24T12:14:26.653511Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2010.02329","last_updated":"2021-03-22T11:44:30Z","snapshot_observed_at":"2026-08-03T21:26:51.269383Z","submitted_at":"2020-10-05T20:49:26Z","title":"InfoBERT: Improving Robustness of Language Models from An Information Theoretic Perspective","version":4},"cited_work":{"arxiv_id":"2010.02329","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2010.02329","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Jia, Bo Li, and Jingjing Liu","venue":null,"work_id":"d8d8619e-4434-4e54-9538-e0561b65c40a","year":2010},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2010.02329","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:a38abf377c92cf936d2070f592702db2aeb95eb525d599b72bd2beefb9f104f2","observation_id":"a8585808-b885-480e-b8ee-e0a9b1efe396","resolution":{"observed_at":"2026-05-24T12:14:26.624252Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.09193","last_updated":"2021-09-19T19:00:07Z","snapshot_observed_at":"2026-07-06T11:49:17.554557Z","submitted_at":"2021-09-19T19:00:07Z","title":"Towards Zero-Label Language Learning","version":1},"cited_work":{"arxiv_id":"2109.09193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.09193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Towards zero-label language learning.ArXiv, abs/2109.09193","venue":null,"work_id":"12a68a2c-1945-40bc-a407-7c2dcb0439b1","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2109.09193","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:7e7ec84ef4f26e5e258df1f6e88dacd5f9da36230cb144dd17cb1ad54307f916","observation_id":"30bd5f71-2927-41e8-8907-6617bc661170","resolution":{"observed_at":"2026-05-24T12:14:26.610742Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":"2109.01652","doi":"10.3030/823782","metadata_source":"pith","pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Finetuned Language Models Are Zero-Shot Learners","venue":"cs.CL","work_id":"7ed6cdaa-ed67-4db4-aceb-b7e1b0e6e7c4","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:69d50fad5b509d0667bfccafe79ffc49bfd8a4e1c2dded8cbbb3d2530b5db610","observation_id":"f9efcea2-65d2-437e-adf1-d3b999de156d","resolution":{"observed_at":"2026-05-24T12:14:26.522602Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"cited_work":{"arxiv_id":"2112.04359","doi":"10.48550/arxiv.2112.04359","metadata_source":"pith","pith_arxiv_id":"2112.04359","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Ethical and social risks of harm from Language Models","venue":"cs.CL","work_id":"b4ce1c45-ef69-445a-a872-dbb785b485e9","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2112.04359","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:fde2a4d9ab29f0e9cad1263b83b69707afd16713699fdf7621c1a3c327f0adb3","observation_id":"55f60e0e-276c-47c1-a39f-c3e23ec02e06","resolution":{"observed_at":"2026-05-24T12:14:26.682178Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:50:40.702477+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:50:40.702477+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07445","last_updated":"2021-09-15T17:27:06Z","snapshot_observed_at":"2026-08-03T15:37:24.202795Z","submitted_at":"2021-09-15T17:27:06Z","title":"Challenges in Detoxifying Language Models","version":1},"cited_work":{"arxiv_id":"2109.07445","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.07445","snapshot_observed_at":"2026-06-29T13:33:28.439743Z","title":"Challenges in detoxifying language models","venue":null,"work_id":"b9fbee43-f57e-4d5b-a8db-7a89a89c2344","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2109.07445","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:962124f54c7a3fa8d90c3731a60c26aa28ffa0fa1bdd11e1cc7de1649aecc687","observation_id":"186a5027-f14d-4885-85f4-8e785660a588","resolution":{"observed_at":"2026-05-24T12:14:26.647929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A broad-coverage challenge corpus for sen- tence understanding through inference","venue":null,"work_id":"340fae8e-6328-4e40-b7a5-38c0e850f933","year":2018},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:fa98932d909bb357f03453deb8894b655995ab1b16c10131f5ef51552e639fae","observation_id":"4cac1c9b-8be2-4863-b4da-6c735cd43960","resolution":{"observed_at":"2026-05-24T12:14:28.209694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04725","last_updated":"2021-10-12T02:25:35Z","snapshot_observed_at":"2026-08-06T01:42:43.774197Z","submitted_at":"2021-10-10T07:40:22Z","title":"Yuan 1.0: Large-Scale Pre-trained Language Model in Zero-Shot and Few-Shot Learning","version":2},"cited_work":{"arxiv_id":"2110.04725","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2110.04725","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yuan 1.0: Large-scale pre-trained language model in zero-shot and few-shot learning","venue":null,"work_id":"2492c13b-980b-4c7a-ab9a-9c286e174189","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2110.04725","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:243355fdeabc39683a4528e076b07ce97120662930fc26ab7eb621ea295098ea","observation_id":"724c78f5-694e-4ffe-afd8-5311deda88c0","resolution":{"observed_at":"2026-05-24T12:14:26.689281Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11373","last_updated":"2019-01-31T14:29:35Z","snapshot_observed_at":"2026-07-06T07:30:18.170401Z","submitted_at":"2019-01-31T14:29:35Z","title":"Learning and Evaluating General Linguistic Intelligence","version":1},"cited_work":{"arxiv_id":"1901.11373","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.11373","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning and Evaluating General Linguistic Intelligence","venue":"cs.LG","work_id":"29fd3485-ad71-4ae6-b96f-d35675eddb26","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1901.11373","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:1cfea2782978dd04281eea6689ace032edf92719ca5837f43be26ad14e953e12","observation_id":"807f0376-60e0-4910-ba28-ecc2a63210d5","resolution":{"observed_at":"2026-05-24T12:14:26.676273Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hellaswag: Can a machine really ﬁnish your sentence? In ACL","venue":null,"work_id":"8369a844-0591-4300-8bcd-ce7618aca774","year":2019},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:3f316b24d30ae8a81f30873dbb90cdcf18dfcef0805649d21041f8ece4508a37","observation_id":"cdba02d7-1457-4bf5-839e-e6058e4d5a9d","resolution":{"observed_at":"2026-05-24T12:14:28.204980Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12616","last_updated":"2020-12-11T16:17:17Z","snapshot_observed_at":"2026-07-06T07:56:30.864880Z","submitted_at":"2019-05-29T17:58:52Z","title":"Defending Against Neural Fake News","version":3},"cited_work":{"arxiv_id":"1905.12616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.12616","snapshot_observed_at":"2026-06-30T17:34:57.491104Z","title":"Defending against neural fake news","venue":null,"work_id":"a9b1d209-1cac-4415-9687-0ec9ae25c6a6","year":2020},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1905.12616","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:090ca0d9fdba7432e49a687c69f4a1c7e17d55c6574a2fea39f6dcd4cde09b4e","observation_id":"41f90178-98a2-4fef-8b57-31015b5cf302","resolution":{"observed_at":"2026-05-24T12:14:26.707955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.12369","last_updated":"2021-04-26T06:59:36Z","snapshot_observed_at":"2026-07-06T11:03:32.600911Z","submitted_at":"2021-04-26T06:59:36Z","title":"PanGu-$\\alpha$: Large-scale Autoregressive Pretrained Chinese Language Models with Auto-parallel Computation","version":1},"cited_work":{"arxiv_id":"2104.12369","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2104.12369","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"subcases","venue":null,"work_id":"8a8a1d50-cc53-4267-9ab2-956f12166b43","year":2021},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/2104.12369","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:79ec385abde6bef5a328abe67cd30ca507c8bfbbf7f62b24140343933a18911c","observation_id":"a29f3d72-3466-4234-b011-c3164ddc53b9","resolution":{"observed_at":"2026-05-24T12:14:26.701333Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model"},"reference_resolution":{"displayed":78,"state_counts":{"malformed_identifier":0,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":5,"verified_exact":30,"verified_fuzzy":40},"total_outbound_references":78},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 78 of 78 outbound references and 57 inbound Pith citation observations for arXiv:2201.11990."}