{"as_of":"2026-08-24T01:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6c5cf9e477911861b626a0f2f3b499b2e3655ce145b2038f8859bf7682e31546","coverage":[{"denominator":21,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":21,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T12:17:39.804430Z","state":"measured"},{"denominator":21,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":21,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2504.13236/citation-record","integrity":"/paper/2504.13236/integrity","json":"/paper/2504.13236/citation-record.json","paper":"/paper/2504.13236"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.120976Z","title":null,"venue":null,"work_id":"64306f47-f3c5-4730-81c0-5a68e7ec1f84","year":null},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.713542Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:a051d4411269ea3bc68052410c3dffdfe6829decd15a8671166dba5ed4eb3b34","observation_id":"62695e59-c9dd-491b-a756-bfa3ce51bf88","resolution":{"observed_at":"2026-08-16T12:17:40.125394Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.107326Z","title":"Vaswani, N","venue":null,"work_id":"689efe67-f9db-4b07-ab88-08418f577ffb","year":2017},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.718374Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:c4902bc11dbb1b8fa82c7955bf5b965edcf05642d16b31efcddf32b224f6f92c","observation_id":"60842bd5-c7ed-4157-9f53-1f1d539f19c7","resolution":{"observed_at":"2026-08-16T12:17:40.111827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-16T12:17:39.722712Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.722712Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:27ed97f4408c21eb51929f33edff9ee80f4695e0aa647d4b1bf4ab8dc53a81ac","observation_id":"bcc0055a-fdc1-4cde-ab44-8a5a49203211","resolution":{"observed_at":"2026-08-16T12:17:39.722712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.093901Z","title":"Hoffmann, S","venue":null,"work_id":"d37ef012-008b-4b97-bc3d-e727bb39a835","year":2022},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.727269Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:f441b91866f711933fc8b104afa2942627708e1556a8e2d395e2d853b866c272","observation_id":"d42d8ce3-6bcc-46de-9ae8-34ce565d96eb","resolution":{"observed_at":"2026-08-16T12:17:40.098138Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.079454Z","title":"Rasley, S","venue":null,"work_id":"3565eccd-d5b9-4973-8b18-743468e75eed","year":2020},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.731799Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:aab13c90cc11f9267be02fd0cf639a6ed15221e75b0fe088263c432e803cc2e2","observation_id":"2be7aea8-9ac9-4d7d-bc82-f734f9810d65","resolution":{"observed_at":"2026-08-16T12:17:40.083938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.064511Z","title":"Deepspeed-inference: enabling efficient inference of transformer models at unprecedented scale","venue":null,"work_id":"7fb303b6-8431-4b35-ab82-d91db67695f6","year":2022},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.736561Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:3006181a4d724caec938b247aaaccc1d245571517f8643a93ecdb72b34f4596b","observation_id":"d8e36b04-710e-4711-8a11-3aa8cc4aa20e","resolution":{"observed_at":"2026-08-16T12:17:40.069139Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-16T12:17:39.741139Z","title":"Shoeybi, M","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.741139Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:c206a0755c2b9f8b7c0160ba17428d50412f9082d69e992fc6101efcce130f4c","observation_id":"d18518d4-5e76-4de3-a380-16cd3c5ce868","resolution":{"observed_at":"2026-08-16T12:17:39.741139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-08-20T20:09:31.615952Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11990","snapshot_observed_at":"2026-08-16T12:17:39.746409Z","title":"Smith, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.746409Z"},"links":{"cited_paper":"/paper/2201.11990","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:c388436611d9945f3fc8557493afe8c04263c7adcfe55447d683faf935ba08af","observation_id":"af585837-20ad-4b2a-8da2-e0e9cb67da58","resolution":{"observed_at":"2026-08-16T12:17:39.746409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.048802Z","title":"Korthikanti, J","venue":null,"work_id":"2e479a91-13b7-48f9-afaa-5737e920ce9c","year":2023},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.750882Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:ee508df3ad4ff95509c1df8677dd2b3e67b74826f6696a176a83dd1e5ea21da9","observation_id":"c7b91100-0e4b-470e-b99b-6d32b1b964c9","resolution":{"observed_at":"2026-08-16T12:17:40.054198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.032232Z","title":"Jiang, H","venue":null,"work_id":"ed76803f-ac13-4211-bf7c-33d37d1579fa","year":2024},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.755187Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:b4f821914cc215ee5df4e7b8d8001e25bd5b3fdcefaedb14080757f491fea300","observation_id":"7632246f-237e-44d3-ae61-f4745e67c4da","resolution":{"observed_at":"2026-08-16T12:17:40.036948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.016829Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":"f16b948e-5bf6-42e0-855f-44e2ff7d41bc","year":2019},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.759484Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:448dc17626819c022166dc1905cc5c6da4f69f225727a83908898d52af655e05","observation_id":"6e5a3301-c468-41b0-80c5-ec2bb3ed85bc","resolution":{"observed_at":"2026-08-16T12:17:40.021515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-16T12:17:39.764362Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.764362Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:48418cff7330405cc2606c15f36b19645a8e18d91c87cf17b2aecc81ad12daed","observation_id":"0868ae92-2393-467d-b614-ea93ebb61926","resolution":{"observed_at":"2026-08-16T12:17:39.764362Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:40.001701Z","title":"Survey on efficient training of large neural networks","venue":null,"work_id":"6304151c-e53f-48ce-a4c3-5237348b49d6","year":2022},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.768679Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:9c43cc6b1069bd20efa62e07bc83c9b0ed4f93e89f4774ec136f98a983663235","observation_id":"10ebc212-fef4-4d13-a586-c46fdf45980b","resolution":{"observed_at":"2026-08-16T12:17:40.006608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.16867","snapshot_observed_at":"2026-08-16T12:17:39.773213Z","title":"Almazrouei, H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.773213Z"},"links":{"cited_paper":"/paper/2311.16867","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:6b556a2b75cc0bcadf7c49d15af804bbdc190055479facb315df016f01eb8328","observation_id":"55b5ebb2-29b7-4cd3-a23c-a09e9981c9dd","resolution":{"observed_at":"2026-08-16T12:17:39.773213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:39.986412Z","title":"StarPU: A Unified Plat- form for Task Scheduling on Heterogeneous Multicore Architectures","venue":null,"work_id":"b6e33e10-90f9-4790-88dd-a339d33e4f2e","year":2009},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.777999Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:1f04b6379b70b4ecb816b63146299a964212d263bf2578e155f8c2215f3d35be","observation_id":"1b8e6874-fb88-4947-a51b-fd622adec78d","resolution":{"observed_at":"2026-08-16T12:17:39.991945Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:39.971449Z","title":"A hybridization methodology for high-performance linear algebra software for gpus","venue":null,"work_id":"e344fc2b-cf29-4b85-afca-c339bc6f8170","year":2012},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.782203Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:a1db8806f102ea4ce6544f1aea151249771e83d9e1d59f7cd86f5c61c8ddd17d","observation_id":"4adfd3cf-ea36-4fc5-b919-e982a7ad440c","resolution":{"observed_at":"2026-08-16T12:17:39.976930Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-15T04:53:45.483331Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-16T12:17:39.786539Z","title":"Layer normalization","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.786539Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:4a874d95f5b9041320516ab79ae89594beaa7586ff8244b81eed23c4560a307e","observation_id":"3850ef14-8469-4c5a-af09-b94ca7fe8208","resolution":{"observed_at":"2026-08-16T12:17:39.786539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:39.791701Z","title":"On layer normalization in the transformer architecture","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.791701Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:c1b3cb7d2ef78b47046e3fdd2a555398402e0f74d9a47e11bdbe9edc1862dc72","observation_id":"8c766d9e-7cbb-49b7-b65b-cb9eeea70cdc","resolution":{"observed_at":"2026-08-16T12:17:39.791701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T12:17:39.945820Z","title":"Accelerated optimization for machine learning","venue":null,"work_id":"5c3a1efe-19fa-4de6-84a9-f500d5920428","year":2020},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.795795Z"},"links":{"citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:aad8981abde1a4f729ed3a56ce90c810ba4e5511e9e1a2dceed16a1fa3cee162","observation_id":"790043bf-492e-47e6-be35-f1b16f827c4c","resolution":{"observed_at":"2026-08-16T12:17:39.951813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-16T12:17:39.800076Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.800076Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:fe2bb8688091ab45141aee6025e36b6a330bed253748655d0cd4eaef18763163","observation_id":"713a7ab2-a663-4fd7-94d7-ed8a61deb584","resolution":{"observed_at":"2026-08-16T12:17:39.800076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-16T12:17:39.804430Z","title":"Fixing weight decay regularization in Adam","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T12:17:39.804430Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2504.13236"},"observation_digest":"sha256:d6ed87b5004ee5a231e48fe79e46ae30259ad5c19f33eee363dc1e0db6a342a5","observation_id":"4b9cbf1b-5945-4c4c-9621-8cd7bac7917c","resolution":{"observed_at":"2026-08-16T12:17:39.804430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.13236","last_updated":"2025-04-17T16:22:32Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-20T20:09:50.729868Z","submitted_at":"2025-04-17T16:22:32Z","title":"NNTile: a machine learning framework capable of training extremely large GPT language models on a single node"},"reference_resolution":{"displayed":21,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":10,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":21},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 24 August 2026, this Paper Citation Record lists 21 of 21 outbound references and 0 inbound Pith citation observations for arXiv:2504.13236."}