{"as_of":"2026-08-06T19:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:192e31ef55a4c202d0d9c8f093ae7f826664c245887da186fe665f8ee05cd6b0","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-12T10:47:18.426912Z","state":"measured"},{"denominator":125,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":125,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-06T06:34:29.942622+00:00","state":"measured"},{"denominator":91,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":91,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:33:46.106088Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":881,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T19:50:53.385943Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/1904.10509"},"observation_digest":"sha256:a3a4e339639fba8b44f01214078d1d5a2b8739f1da50f3444b97ea9c0e85de34","observation_id":"a824fe61-61ec-4f90-88e4-8f29eaeba519","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"1906.11282","last_updated":"2019-06-26T18:14:18Z","snapshot_observed_at":"2026-08-03T01:23:11.689940Z","submitted_at":"2019-06-26T18:14:18Z","title":"Developing an App to interpret Chest X-rays to support the diagnosis of respiratory pathology with Artificial Intelligence","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-25T15:27:50.775068Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/1906.11282"},"observation_digest":"sha256:b8659886229e0d10e917f77627fb1036d7af104ae978000aa8c84f99fbc82572","observation_id":"bf1b857a-cb86-42b0-a368-0844c286b0b6","resolution":{"observed_at":"2026-05-25T15:30:58.727140Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2006.04768","last_updated":"2020-06-14T08:15:54Z","snapshot_observed_at":"2026-07-06T09:27:03.809621Z","submitted_at":"2020-06-08T17:37:52Z","title":"Linformer: Self-Attention with Linear Complexity","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-12T00:37:42.175821Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2006.04768"},"observation_digest":"sha256:837486a8f85e01490f1d7cf0cfc6e376130f387e2f9958bd52c8207a6727f400","observation_id":"8252ff9c-cb02-43da-9fe1-3e5966c3ccff","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-12T23:57:10.953617Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2101.03961"},"observation_digest":"sha256:b391df405662a1c8e03a403191b8df173f9e7e879b02598d4d9413c368394c84","observation_id":"d44ab550-a2b6-4b4c-ba4d-e0ea03e4e705","resolution":{"observed_at":"2026-05-12T23:57:11.082719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2105.05233","last_updated":"2021-06-01T17:49:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-05-11T17:50:24Z","title":"Diffusion Models Beat GANs on Image Synthesis","version":4},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T11:16:28.445702Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2105.05233"},"observation_digest":"sha256:292a8921fa47fc5a2d8f47310a0b9d58d1df1c792d9c826d3757716964401a23","observation_id":"7d377072-6f0f-49d4-9013-741f7fe79fd0","resolution":{"observed_at":"2026-05-13T11:16:28.586797Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2112.10741","last_updated":"2022-03-08T18:18:49Z","snapshot_observed_at":"2026-08-02T18:14:47.498475Z","submitted_at":"2021-12-20T18:42:55Z","title":"GLIDE: Towards Photorealistic Image Generation and Editing with Text-Guided Diffusion Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-11T05:56:10.970591Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2112.10741"},"observation_digest":"sha256:96f18a37f55f818bbef974647988f753d891b99b22c2664da04a7f8ffbdbe5bb","observation_id":"953b321d-ebfe-424a-8ba9-d600cfd863b3","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2201.11990","last_updated":"2022-02-04T18:02:23Z","snapshot_observed_at":"2026-07-06T12:32:10.267841Z","submitted_at":"2022-01-28T08:59:57Z","title":"Using DeepSpeed and Megatron to Train Megatron-Turing NLG 530B, A Large-Scale Generative Language Model","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-24T12:10:49.690618Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2201.11990"},"observation_digest":"sha256:d2d4a9ac1383dcf94d7192ed499f06848d592151cba4338364df96654aa9a345","observation_id":"1a9df28b-c310-4be6-a43c-706ca4c966dc","resolution":{"observed_at":"2026-05-24T12:14:26.665627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2202.08906","last_updated":"2022-04-29T23:24:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-17T21:39:10Z","title":"ST-MoE: Designing Stable and Transferable Sparse Expert Models","version":2},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-05-12T23:14:25.431471Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2202.08906"},"observation_digest":"sha256:fc066120fc0e679b1cd7ae59ddc19f35c9871f1217aaf3530080f15c8542e473","observation_id":"ebc84573-3cf5-4c82-928d-eead031d06cf","resolution":{"observed_at":"2026-05-12T23:14:25.679737Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":262,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:7e81a6101a6510de5439c50a8fa045ceb328232dcf8e8ec2579b825a8ab34621","observation_id":"bd3e615d-7048-43d5-973b-45c4cf224622","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-13T13:35:35.972596Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2208.07339"},"observation_digest":"sha256:a151ed004f8bfa5a447195f77ca8ae010d1b98d064a992b6efe48f7b85517238","observation_id":"113c12a2-5361-4b7f-9982-2799f97d52c0","resolution":{"observed_at":"2026-05-13T13:35:36.213382Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-07-06T13:51:20.183063Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-15T09:47:03.766814Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2209.05433"},"observation_digest":"sha256:d731bc09d8242f2cf199f554c24f5f3ea03c2c9b81a6a9b65180944a2d33b07a","observation_id":"30433775-5f2f-41dc-8b12-ce08937b50fd","resolution":{"observed_at":"2026-05-15T09:47:03.804578Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-12T04:15:20.027659Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2304.11277"},"observation_digest":"sha256:1467d1a726f2f0c3a9a18de46a377fe3f09a5091e06e4bd14d1f19cd788cce68","observation_id":"a5d5bb79-16c7-4e39-add7-b4fa1c58d15c","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2305.02463","last_updated":"2023-05-03T23:59:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-03T23:59:13Z","title":"Shap-E: Generating Conditional 3D Implicit Functions","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-16T15:32:06.563955Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2305.02463"},"observation_digest":"sha256:85dab22b4abf62702d5083372854697246b2c47c1ad60c611f16246ea8345589","observation_id":"a92996a4-05f8-4158-bb2f-3654312297f0","resolution":{"observed_at":"2026-05-16T15:32:06.815209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":120,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:07d02fd20837e1e4179d6090f7152abacf21ef768cafcd79935ef0b849b4fe35","observation_id":"0ed13e76-a2e1-41d2-b3d0-bfbbc39eb9c5","resolution":{"observed_at":"2026-05-19T20:28:39.405719Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2406.08334","last_updated":"2026-04-20T05:53:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T15:40:06Z","title":"ProTrain: Efficient LLM Training via Memory-Aware Techniques","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-23T23:48:40.669335Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2406.08334"},"observation_digest":"sha256:07776f75a0b58df616240114a00944b20935d4700b609f67dcef0e91db2dff3a","observation_id":"548899d1-2ad8-4a30-b1c7-2ad63b6e2f83","resolution":{"observed_at":"2026-05-23T23:53:39.392205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T18:33:46.106088Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.08119","last_updated":"2025-07-10T19:14:16Z","snapshot_observed_at":"2026-08-06T18:25:19.960511Z","submitted_at":"2025-07-10T19:14:16Z","title":"Photonic Rails in ML Datacenters","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T18:33:46.106088Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.08119"},"observation_digest":"sha256:d91ad18b14d7d21a94e0a3ad2aaec394d37fe49635cb19cf6dcdd097ca16ea6f","observation_id":"e3d0da13-a8ab-4303-9227-4c40776f028e","resolution":{"observed_at":"2026-08-06T18:33:46.106088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T12:28:42.897424Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2507.21749","last_updated":"2025-07-29T12:31:21Z","snapshot_observed_at":"2026-08-06T16:58:34.640397Z","submitted_at":"2025-07-29T12:31:21Z","title":"Improving Neural Network Training using Dynamic Learning Rate Schedule for PINNs and Image Classification","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T12:28:42.897424Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.21749"},"observation_digest":"sha256:d6079b937854578352f1029b0c7aad10e33feb64b97d4b99db558b92a11f963a","observation_id":"0709dafb-e8f4-4538-a3b7-654533c215f0","resolution":{"observed_at":"2026-08-06T12:28:42.897424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T11:12:47.773343Z","title":"2018, Mixed Precision Training","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.23019","last_updated":"2025-07-30T18:32:16Z","snapshot_observed_at":"2026-08-06T11:12:26.195747Z","submitted_at":"2025-07-30T18:32:16Z","title":"Capturing star formation activity from compressed photometric images of galaxies","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:12:47.773343Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.23019"},"observation_digest":"sha256:6a834a9d2d89037318c548663e3a710b6e7151328bcc5e33374c437b54bc8520","observation_id":"12a5bcad-f3b7-4531-bcf0-fdf3fd42e2e9","resolution":{"observed_at":"2026-08-06T11:12:47.773343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2507.23387","last_updated":"2026-05-06T12:03:33Z","snapshot_observed_at":"2026-08-03T01:16:01.239469Z","submitted_at":"2025-07-31T10:02:26Z","title":"SGEMM-cube: Precision-Recovery FP32 GEMM Approximation on Ascend NPUs with FP16 Matrix Engines","version":4},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-19T02:58:03.731344Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2507.23387"},"observation_digest":"sha256:6986b44c0d60688f4f3df4eba2d9b8acb84e0a739194dee0ba141fb756754121","observation_id":"54095e89-42d2-4972-81c1-2979a6db467f","resolution":{"observed_at":"2026-05-19T03:02:00.438856Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-06T00:55:20.049340Z","title":"Mixed precision training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.04181","last_updated":"2025-08-06T08:08:04Z","snapshot_observed_at":"2026-08-06T00:55:17.204680Z","submitted_at":"2025-08-06T08:08:04Z","title":"Deeper Inside Deep ViT","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:55:20.049340Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.04181"},"observation_digest":"sha256:60c1d3f94471dc2403fb1ca929e87f197c866e476012b22f201353254011a65b","observation_id":"1a83d089-c7e7-4221-bfd1-2f50f44f79ff","resolution":{"observed_at":"2026-08-06T00:55:20.049340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T23:16:05.942020Z","title":"Micikevicius, S","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.05624","last_updated":"2025-08-07T17:58:16Z","snapshot_observed_at":"2026-08-05T23:16:03.335886Z","submitted_at":"2025-08-07T17:58:16Z","title":"Latent Space Diffusion for Topology Optimization","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T23:16:05.942020Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.05624"},"observation_digest":"sha256:2b501df29e72251c633c2a45b3054957e4beedfd29662db2952dd2a946222d45","observation_id":"e8b163f8-ddcd-4895-a836-a1ac0f2432e6","resolution":{"observed_at":"2026-08-05T23:16:05.942020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T20:25:11.986236Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.10615","last_updated":"2025-08-14T13:12:29Z","snapshot_observed_at":"2026-08-06T19:53:35.593518Z","submitted_at":"2025-08-14T13:12:29Z","title":"FuXi-\\beta: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T20:25:11.986236Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.10615"},"observation_digest":"sha256:e41d2b30e56884057646ca20af27fa7c6785aaa336f7c537bf848a7f4f7d8719","observation_id":"179992bc-633f-423e-b613-1ff2f1a0bb52","resolution":{"observed_at":"2026-08-05T20:25:11.986236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T19:31:03.262734Z","title":"Micikevicius, S","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.14106","last_updated":"2025-08-23T10:36:18Z","snapshot_observed_at":"2026-08-05T19:30:59.997593Z","submitted_at":"2025-08-17T22:05:58Z","title":"High-Throughput Low-Cost Segmentation of Brightfield Microscopy Live Cell Images","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T19:31:03.262734Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.14106"},"observation_digest":"sha256:6ba86ae0f10772da3f1d02b01fdd9384f3b1bfd93424aeaadd5d55bbc80925e6","observation_id":"a449d549-3360-49b8-ab79-cbc4be626e23","resolution":{"observed_at":"2026-08-05T19:31:03.262734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T14:55:48.343059Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.20762","last_updated":"2025-08-28T13:17:35Z","snapshot_observed_at":"2026-08-06T17:31:12.929628Z","submitted_at":"2025-08-28T13:17:35Z","title":"SKGE-SWIN: End-To-End Autonomous Vehicle Waypoint Prediction and Navigation Using Skip Stage Swin Transformer","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T14:55:48.343059Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2508.20762"},"observation_digest":"sha256:76051b2375afc13f6a90a89899fa375c0852acc8f92fb50417f95490e9196170","observation_id":"d51445d3-5a1e-4ea4-ac66-966b0244ce71","resolution":{"observed_at":"2026-08-05T14:55:48.343059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T11:38:40.255601Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.02480","last_updated":"2025-09-02T16:30:49Z","snapshot_observed_at":"2026-08-06T06:29:15.194892Z","submitted_at":"2025-09-02T16:30:49Z","title":"MLP-Offload: Multi-Level, Multi-Path Offloading for LLM Pre-training to Break the GPU Memory Wall","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T11:38:40.255601Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2509.02480"},"observation_digest":"sha256:84b08b041f84f8944f279201abd7c17634669892a9ec5db9027e83d0aaef127c","observation_id":"ddd2ba66-2cfd-46d5-92d6-2e00f250bd34","resolution":{"observed_at":"2026-08-05T11:38:40.255601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2509.09682","last_updated":"2026-05-20T09:23:36Z","snapshot_observed_at":"2026-08-02T10:23:41.548004Z","submitted_at":"2025-08-13T15:03:38Z","title":"Faster and Memory-Efficient Training of Sequential Recommendation Models for Large Catalogs","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-21T23:23:26.304190Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2509.09682"},"observation_digest":"sha256:8af5ea7ba0620a0333f867646f5c183726100fb8af859be51bb02cb781cabbf9","observation_id":"610ade97-66bf-4886-9f68-fdf64f62c82d","resolution":{"observed_at":"2026-05-21T23:24:26.189442Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-04T18:37:32.603833Z","title":"Available: https://arxiv.org/abs/1710.03740 9 APPENDIX A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09859","last_updated":"2025-09-11T21:18:32Z","snapshot_observed_at":"2026-08-04T18:37:32.073329Z","submitted_at":"2025-09-11T21:18:32Z","title":"WAVE-DETR Multi-Modal Visible and Acoustic Real-Life Drone Detector","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-04T18:37:32.603833Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2509.09859"},"observation_digest":"sha256:035fc66761477b84d17e9db9780e5c0f9e5ca90dc964286f87f61081daa8bf69","observation_id":"95f26a6c-6ca6-4fd6-be95-0696502e61a3","resolution":{"observed_at":"2026-08-04T18:37:32.603833Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-04T14:51:29.901853Z","title":"Mixed precision training, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2509.22536","last_updated":"2026-08-02T17:29:40Z","snapshot_observed_at":"2026-08-06T19:19:26.011991Z","submitted_at":"2025-09-26T16:16:49Z","title":"A Comprehensive FP8 Training Recipe for Reasoning-Enhanced Language Models","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T14:51:29.901853Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2509.22536"},"observation_digest":"sha256:c4865e434ee6de4ea4104c3061fe1268d8f50cf8c29e1ea69a9febe252e4d005","observation_id":"1b17e08e-74f0-41d0-aaa7-aef6b2548bd9","resolution":{"observed_at":"2026-08-04T14:51:29.901853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2510.04212","last_updated":"2026-04-18T01:36:25Z","snapshot_observed_at":"2026-08-05T11:27:54.389799Z","submitted_at":"2025-10-05T14:01:24Z","title":"Why Low-Precision Transformer Training Fails: An Analysis on Flash Attention","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-18T10:01:56.131253Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2510.04212"},"observation_digest":"sha256:19e264d0ad1cdb821ba4d8f51d9063bdfa2ffa3d654cdb3397990d170c0f32a2","observation_id":"7b607e40-1368-4393-880c-4fb464af087f","resolution":{"observed_at":"2026-05-18T10:02:31.654634Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2510.08008","last_updated":"2026-05-15T08:53:04Z","snapshot_observed_at":"2026-08-03T22:05:31.756040Z","submitted_at":"2025-10-09T09:45:45Z","title":"Beyond Sunk Costs: Boosting LLM Pre-training Efficiency via Orthogonal Growth of Mixture-of-Experts","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-21T20:36:22.974054Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2510.08008"},"observation_digest":"sha256:27afb017494b936f064bda360b0a16c6a2fc15e4c866ba8fd71581ec6f4b506c","observation_id":"9336dca8-1076-49c9-9027-8133d3658ce0","resolution":{"observed_at":"2026-05-21T20:40:36.488871Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2511.06731","last_updated":"2026-04-03T13:19:58Z","snapshot_observed_at":"2026-08-02T04:51:43.287809Z","submitted_at":"2025-11-10T05:52:43Z","title":"Recovering Sub-threshold S-wave Arrivals in Deep Learning Phase Pickers via Shape-Aware Loss","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T00:25:33.663795Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2511.06731"},"observation_digest":"sha256:c912bb15640a5ec9e0eb70fe32412836b590953a671974ce9b2ef4d6d110eed6","observation_id":"3ce20d44-5521-45a0-9a24-eaa25c758f48","resolution":{"observed_at":"2026-05-18T00:30:33.222459Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2511.17031","last_updated":"2026-05-12T19:37:16Z","snapshot_observed_at":"2026-07-31T06:45:43.083670Z","submitted_at":"2025-11-21T08:12:47Z","title":"Energy Scaling Laws for Diffusion Models: Quantifying Compute in Image Generation","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-17T21:08:23.500137Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2511.17031"},"observation_digest":"sha256:e5ea38e2e77b004c5c654b23dc92a1d6ce7e002e87ae9c22426ab70b8ccb1c28","observation_id":"c1b94ed4-d658-493c-b3ec-11b7c6f06b04","resolution":{"observed_at":"2026-05-17T21:10:16.397654Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2512.02010","last_updated":"2026-05-09T05:39:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-01T18:59:45Z","title":"Four Over Six: More Accurate NVFP4 Quantization with Adaptive Block Scaling","version":5},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-17T02:23:01.845123Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2512.02010"},"observation_digest":"sha256:d1d89fc5259b9baeb6285b6bd725f6e0d4d3b8eb57746b5e2a7a54033c10f92f","observation_id":"62702f3f-423f-4e2e-83d0-bcfb6bed084a","resolution":{"observed_at":"2026-05-17T02:23:52.663065Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-03T12:02:01.164567Z","title":"Mixed precision training","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.06199","last_updated":"2026-06-01T03:39:22Z","snapshot_observed_at":"2026-08-06T01:59:30.134013Z","submitted_at":"2026-01-08T07:46:03Z","title":"FastSLM: Hierarchical Temporal Abstraction for Efficient Long-Form Speech Adaptation","version":3},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T12:02:01.164567Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2601.06199"},"observation_digest":"sha256:4df3af113b4c2380d10b4bee9b374db5834f9db442e5b64c5944c13b157c20db","observation_id":"034f50e5-af30-4596-ab27-0bfe5348afb8","resolution":{"observed_at":"2026-08-03T12:02:01.164567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-03T08:30:57.589590Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2601.16956","last_updated":"2026-01-23T18:26:14Z","snapshot_observed_at":"2026-08-03T08:30:54.330112Z","submitted_at":"2026-01-23T18:26:14Z","title":"DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T08:30:57.589590Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2601.16956"},"observation_digest":"sha256:a2dcb4a52191e7393c9828aa978b98f12cc8bad349e75bbb2265256ada4a9d79","observation_id":"79ac9fa6-930f-436d-9db4-42135a710bbc","resolution":{"observed_at":"2026-08-03T08:30:57.589590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2602.06932","last_updated":"2026-05-02T06:02:57Z","snapshot_observed_at":"2026-08-06T14:10:22.450479Z","submitted_at":"2026-02-06T18:28:54Z","title":"When RL Meets Adaptive Speculative Training: A Unified Training-Serving System","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-16T06:33:41.860803Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2602.06932"},"observation_digest":"sha256:15983a063823deef866d9951e7fba30a94445ae4e803f6044b88d5c8f6e21391","observation_id":"8222c87a-a2a1-45ac-8031-35bdeeaea64c","resolution":{"observed_at":"2026-05-16T06:37:28.871752Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2602.17071","last_updated":"2026-04-11T12:06:12Z","snapshot_observed_at":"2026-08-01T04:28:59.324747Z","submitted_at":"2026-02-19T04:26:57Z","title":"AdvSynGNN: Structure-Adaptive Graph Neural Nets via Adversarial Synthesis and Self-Corrective Propagation","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-15T21:30:43.925179Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2602.17071"},"observation_digest":"sha256:5f407d85daad23c92d343a9c68a9aaa4bc02799d2052a49c8b8bfdd0a02da239","observation_id":"bba21370-4ba9-4ded-8f6c-fd92c3379226","resolution":{"observed_at":"2026-05-15T21:31:39.340990Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-15T14:02:44.140957Z","title":"Micikevicius et al.Mixed Precision Training","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.06060","last_updated":"2026-07-03T09:12:31Z","snapshot_observed_at":"2026-07-30T23:34:25.200692Z","submitted_at":"2026-03-06T09:11:44Z","title":"What is New in Stochastic Rounding: a Survey on Theory, Hardware, and Applications","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-15T14:02:44.140957Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2603.06060"},"observation_digest":"sha256:f03b223b4ff8b429e5f8078a4587f17c9d214684a7cb0eb15c0d24280ead38de","observation_id":"d92865d6-ffd4-48df-9f5e-87bee74a35a4","resolution":{"observed_at":"2026-07-15T14:02:44.140957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2603.14360","last_updated":"2026-05-13T23:29:01Z","snapshot_observed_at":"2026-08-01T09:38:25.349230Z","submitted_at":"2026-03-15T12:53:09Z","title":"M$^2$RNN: Non-Linear RNNs with Matrix-Valued States for Scalable Language Modeling","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-15T11:35:43.088803Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2603.14360"},"observation_digest":"sha256:ae35e9868a6d1a457773a223cb5ec14ba5bad873ad754e049452b44c92678db1","observation_id":"d6f40af6-7c12-4e8e-b202-c999b78105c3","resolution":{"observed_at":"2026-05-15T11:39:59.319717Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-13T23:47:39.219131Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2603.16428","last_updated":"2026-06-30T09:50:18Z","snapshot_observed_at":"2026-08-02T19:28:16.974196Z","submitted_at":"2026-03-17T12:05:17Z","title":"An Efficient Heterogeneous Co-Design for Fine-Tuning on a Single GPU","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-13T23:47:39.219131Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2603.16428"},"observation_digest":"sha256:135613e3f4acb04e607d5a7e1c18a03722c12ce5fd3f6094887e11a5c84fb19a","observation_id":"eb1847d7-e873-480c-88eb-581c4a5557f4","resolution":{"observed_at":"2026-07-13T23:47:39.219131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.01204","last_updated":"2026-07-09T17:50:12Z","snapshot_observed_at":"2026-08-01T00:05:28.763487Z","submitted_at":"2026-04-01T17:48:22Z","title":"Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T22:21:30.528663Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.01204"},"observation_digest":"sha256:c6912fb0b4fb96b27c0ec9ca169e859403192df8819878b8e12377438ecbcfcb","observation_id":"9000331f-bb79-453e-9025-6a42247bd6de","resolution":{"observed_at":"2026-05-13T22:23:21.271745Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-13T14:31:36.020496Z","title":"arXiv preprint arXiv:1710.03740 (2017) 9","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.01204","last_updated":"2026-07-09T17:50:12Z","snapshot_observed_at":"2026-08-01T00:05:28.763487Z","submitted_at":"2026-04-01T17:48:22Z","title":"Neural Harmonic Textures for High-Quality Primitive Based Neural Reconstruction","version":3},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-13T14:31:36.020496Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.01204"},"observation_digest":"sha256:9dff2aef83255bbca2465167bbc0ac0a589c9597d218c362263c3ee02dbc22f2","observation_id":"39a00492-8d44-470d-b8bb-fc9d52620ae0","resolution":{"observed_at":"2026-07-13T14:31:36.020496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.04078","last_updated":"2026-04-05T11:52:46Z","snapshot_observed_at":"2026-08-05T18:39:48.237036Z","submitted_at":"2026-04-05T11:52:46Z","title":"BAAI Cardiac Agent: An intelligent multimodal agent for automated reasoning and diagnosis of cardiovascular diseases from cardiac magnetic resonance imaging","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-05-14T22:14:41.083628Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.04078"},"observation_digest":"sha256:37fda9e1805f0c2f1c210465d2f63ad1f1c9808eb4cfc089093aaf4d7fe3e47e","observation_id":"6e4071b5-f445-4d21-b229-d19c23457f66","resolution":{"observed_at":"2026-05-14T22:18:04.684943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-10T20:04:56.512544Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:a46659b4ca91788b9a6f1cdd2e3d1404f06e733478c7270aa56d89c237306859","observation_id":"ee2daf57-10fc-4364-91a4-636cd7737a77","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.04539","last_updated":"2026-05-15T07:15:36Z","snapshot_observed_at":"2026-08-02T17:13:51.910717Z","submitted_at":"2026-04-06T09:03:41Z","title":"FlashSAC: Fast and Stable Off-Policy Reinforcement Learning for High-Dimensional Robot Control","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-19T17:08:31.770889Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.04539"},"observation_digest":"sha256:e1d7a397ebb5c393afd4bd88dd557a8a74522f0753fd5e99ae0c4acb91eba234","observation_id":"59c445b3-1153-4913-89c6-01e8bcc82cac","resolution":{"observed_at":"2026-05-19T17:12:41.259530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.08140","last_updated":"2026-04-09T11:56:28Z","snapshot_observed_at":"2026-07-06T22:57:18.202215Z","submitted_at":"2026-04-09T11:56:28Z","title":"Multimodal Reasoning with LLM for Encrypted Traffic Interpretation: A Benchmark","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-10T18:00:59.294760Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.08140"},"observation_digest":"sha256:803126376643197df10a9b55dbfd5c1843ebff421cf6de6924bae9983b383bb0","observation_id":"30790646-d502-4cc6-8ed6-ba1b738bf44c","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.10390","last_updated":"2026-04-12T00:35:08Z","snapshot_observed_at":"2026-07-06T22:59:01.129724Z","submitted_at":"2026-04-12T00:35:08Z","title":"LLM-PRISM: Characterizing Silent Data Corruption from Permanent GPU Faults in LLM Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-10T16:41:25.467287Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.10390"},"observation_digest":"sha256:b54d2dd41ec8fd99909f104934d53824c4076381a0e154d050bf438ec987262f","observation_id":"a35a5520-96b0-45d4-9bbb-08686046beb6","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-12T22:37:03.025712Z","title":"Mixed precision training.arXiv preprint arXiv:1710.03740(2017)","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2604.10492","last_updated":"2026-07-08T04:59:15Z","snapshot_observed_at":"2026-08-06T09:51:53.684514Z","submitted_at":"2026-04-12T06:51:08Z","title":"Aharanov-Bohm Type Arbitrage and Homological Obstructions in Financial Markets","version":5},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-12T22:37:03.025712Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.10492"},"observation_digest":"sha256:191526b81630e39a5ef396abc778602ddb3fb21c0bcda9dd8f37e03f4b8543ed","observation_id":"619b62fd-d8b8-4c56-a10e-31701119aafc","resolution":{"observed_at":"2026-07-12T22:37:03.025712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.10494","last_updated":"2026-04-12T06:55:18Z","snapshot_observed_at":"2026-07-06T22:59:05.519456Z","submitted_at":"2026-04-12T06:55:18Z","title":"From Characterization to Microarchitecture: Designing an Elegant and Reliable BFP-Based NPU","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-10T16:17:03.838762Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.10494"},"observation_digest":"sha256:9374835ee2af742db07ae2c61844d2067fcc7275d59754a62a9543c5b694c4b5","observation_id":"a83f1134-c218-4d72-ab0a-a98b6e3c29d4","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.11152","last_updated":"2026-04-13T08:14:40Z","snapshot_observed_at":"2026-07-06T22:59:36.571641Z","submitted_at":"2026-04-13T08:14:40Z","title":"SHARE: Social-Humanities AI for Research and Education","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:36:31.706714Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.11152"},"observation_digest":"sha256:6ac3f3b67e110389dfab93c0d4373f81d3a4d90afc36a8377c10ffa95a8f61c5","observation_id":"681f6dde-3d52-48b7-8402-68c2e85f6e1d","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.15409","last_updated":"2026-04-16T15:59:40Z","snapshot_observed_at":"2026-07-06T23:02:58.361418Z","submitted_at":"2026-04-16T15:59:40Z","title":"The Illusion of Equivalence: Systematic FP16 Divergence in KV-Cached Autoregressive Inference","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T11:23:37.593409Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.15409"},"observation_digest":"sha256:9685a33e808b123c7f6243be39d8f73ca49f4ae7c37bcea81c838ce28883f773","observation_id":"18af856f-b8c6-44d9-a100-00d1ff2a4499","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.15645","last_updated":"2026-04-17T02:42:08Z","snapshot_observed_at":"2026-08-02T07:06:55.615449Z","submitted_at":"2026-04-17T02:42:08Z","title":"PINNACLE: An Open-Source Computational Framework for Classical and Quantum PINNs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-10T08:46:33.056002Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.15645"},"observation_digest":"sha256:050912c8122bb634281ce39f2b49575c6af7142e13ba1450bd5b2e7766e4ee82","observation_id":"765d2b9f-3db7-4b5b-a5df-a017e70fa2c9","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.16145","last_updated":"2026-04-17T15:18:01Z","snapshot_observed_at":"2026-07-06T23:03:30.601598Z","submitted_at":"2026-04-17T15:18:01Z","title":"Training Time Prediction for Mixed Precision-based Distributed Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-10T08:35:30.857904Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.16145"},"observation_digest":"sha256:08d0d692f96024c53c197452d17e1347550a4de92a0b61ce20f2f3e1c5d4b8c1","observation_id":"1acc07ec-8d4c-4ca5-baaa-a793d671d61b","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.18603","last_updated":"2026-04-09T19:32:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-09T19:32:11Z","title":"Dual Triangle Attention: Effective Bidirectional Attention Without Positional Embeddings","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-05-10T16:50:43.716813Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.18603"},"observation_digest":"sha256:fc8765680c7321829a3f85ca36f5c4fca680ad7a732f1fe89027c71373798f1f","observation_id":"60bed4c2-5b79-4518-ab5d-f1ac506b7ba7","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.19286","last_updated":"2026-04-21T09:53:11Z","snapshot_observed_at":"2026-07-06T23:05:58.167533Z","submitted_at":"2026-04-21T09:53:11Z","title":"Mass Matrix Assembly on Tensor Cores for Implicit Particle-In-Cell Methods","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T01:48:28.819072Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.19286"},"observation_digest":"sha256:e2d2ccf718eed76757f8ee4e759102dd72880d6e8a64fc8f11304ad67e01617d","observation_id":"bb33cd2e-fbfa-4c95-9f78-94dfaca115c9","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.19790","last_updated":"2026-04-02T03:38:47Z","snapshot_observed_at":"2026-07-06T23:06:21.774788Z","submitted_at":"2026-04-02T03:38:47Z","title":"Hidden Reliability Risks in Large Language Models: Systematic Identification of Precision-Induced Output Disagreements","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T21:59:42.435082Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.19790"},"observation_digest":"sha256:8866e65c8c72e002acd43cb98301ce761c83786a772957ec9b77328524495a3f","observation_id":"e77fdc7d-5fc9-433c-a37a-5a8f605cc3d7","resolution":{"observed_at":"2026-05-13T22:03:20.483366Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.24088","last_updated":"2026-04-27T06:27:31Z","snapshot_observed_at":"2026-07-29T22:55:04.073973Z","submitted_at":"2026-04-27T06:27:31Z","title":"TACO: Efficient Communication Compression of Intermediate Tensors for Scalable Tensor-Parallel LLM Training","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-08T01:36:41.804171Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.24088"},"observation_digest":"sha256:94abe99708a9cc40ea2b4b1d9f0f8bcd6ebbff11e93c2b28d0087fb1919d6552","observation_id":"1cbe1891-df5d-405d-8065-5274fb3c9ff6","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.24678","last_updated":"2026-04-27T16:38:01Z","snapshot_observed_at":"2026-07-06T23:10:38.548416Z","submitted_at":"2026-04-27T16:38:01Z","title":"Leveraging LLMs for Multi-File DSL Code Generation: An Industrial Case Study","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-08T02:49:14.533263Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.24678"},"observation_digest":"sha256:9ba481cc452121a6096486f310fed5e76e35dfa057d59f08f74eccbd3b86679f","observation_id":"568a599a-4a5b-435e-b4ec-eddaa0675af3","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.26707","last_updated":"2026-04-29T14:15:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T14:15:45Z","title":"CurEvo: Curriculum-Guided Self-Evolution for Video Understanding","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-07T11:52:26.828633Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.26707"},"observation_digest":"sha256:7a360dbfd23148b2602304b05c86f245c2749980e0a02b1f8c7ea9025b6acad1","observation_id":"0a80b4b3-c510-4dd1-9547-a240d8eef6f4","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2604.27085","last_updated":"2026-04-29T18:26:13Z","snapshot_observed_at":"2026-07-06T23:12:38.453388Z","submitted_at":"2026-04-29T18:26:13Z","title":"Efficient Training on Multiple Consumer GPUs with RoundPipe","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-07T10:37:22.251566Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2604.27085"},"observation_digest":"sha256:fbd5b972a8a705fc9be2b74ed702a27d61b3b14e2d676b85ac8cf2c1b8fbb75a","observation_id":"06f73184-3e99-40d1-9177-d927b6e427a9","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.01330","last_updated":"2026-05-02T08:49:51Z","snapshot_observed_at":"2026-07-06T23:14:33.653260Z","submitted_at":"2026-05-02T08:49:51Z","title":"Colinearity Decay: Training Quantization-Friendly ViTs with Outlier Decay","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-09T14:24:54.946996Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.01330"},"observation_digest":"sha256:c590f6cb1d64f10faa94dc5c3ff1823e76930ac802c3bb4dc1110034baa9809c","observation_id":"86ec1ae3-fb5b-48e8-92be-3841f88b26e3","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.02744","last_updated":"2026-05-04T15:44:08Z","snapshot_observed_at":"2026-07-06T23:15:46.390406Z","submitted_at":"2026-05-04T15:44:08Z","title":"Assessing Performance and Porting Strategies for Gravitational $N$-Body Simulations on the RISC-V-Based Tenstorrent Wormhole\\textsuperscript{\\texttrademark}","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T17:19:30.646807Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.02744"},"observation_digest":"sha256:e746403d6b3e1cc8500caa2586660d42f4c28eca33f5db9fd8140d6f9e473f1f","observation_id":"e1d108a7-84f2-48dc-b7d6-03c18438ea49","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.03476","last_updated":"2026-05-05T08:05:31Z","snapshot_observed_at":"2026-07-30T01:35:47.950953Z","submitted_at":"2026-05-05T08:05:31Z","title":"CuraView: A Multi-Agent Framework for Medical Hallucination Detection with GraphRAG-Enhanced Knowledge Verification","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-07T04:07:33.610288Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.03476"},"observation_digest":"sha256:167065049bbce43a49cf9a7b059c086ae1770003b1dd0815ef4b826ea226b2f9","observation_id":"62a0f38a-93de-470f-ae4c-471906cbe14d","resolution":{"observed_at":"2026-05-12T10:56:30.553230Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.04058","last_updated":"2026-04-10T08:00:28Z","snapshot_observed_at":"2026-07-06T23:16:54.673178Z","submitted_at":"2026-04-10T08:00:28Z","title":"MP-ISMoE: Mixed-Precision Interactive Side Mixture-of-Experts for Efficient Transfer Learning","version":1},"reference_index":141,"source":"arxiv_source","source_observed_at":"2026-05-10T17:19:59.247074Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.04058"},"observation_digest":"sha256:a16e113d55296c696c4d7127982dacb52545f159826a60eb144f8f8c5a9a283c","observation_id":"67f74813-00d8-4f96-9d3b-83f9f86e4c83","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.07245","last_updated":"2026-05-08T05:06:17Z","snapshot_observed_at":"2026-07-06T23:19:35.885430Z","submitted_at":"2026-05-08T05:06:17Z","title":"TransDot: An Area-efficient Reconfigurable Floating-Point Unit for Trans-Precision Dot-Product Accumulation for FPGA AI Engines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-11T01:12:17.548356Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.07245"},"observation_digest":"sha256:5b03eacaef5541b82e1a7c5ad947a6dee3666ceab5e4a0f11f9dc8d2ffca4ab5","observation_id":"bdbee295-32e1-4bef-b1e6-8c1d38669ce9","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.09850","last_updated":"2026-05-11T01:06:25Z","snapshot_observed_at":"2026-07-06T23:21:54.140120Z","submitted_at":"2026-05-11T01:06:25Z","title":"Probing Routing-Conditional Calibration in Attention-Residual Transformers","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T05:05:17.483932Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.09850"},"observation_digest":"sha256:fd3c690d9b0621032efedee1918d320c92151d8f00c451d2d4784a25232b1b72","observation_id":"8991f17d-d2e7-4d2b-b88b-9a51511dc8ff","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-12T04:33:41.411292Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:5a240bb52254bdabf10c56b51b434dd95f9c3d2529e2e69b7b3ceadcdc5e81d3","observation_id":"3294d2ed-7a08-4c8a-add6-ede6afa1af74","resolution":{"observed_at":"2026-05-12T10:47:18.676998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.10886","last_updated":"2026-07-09T02:30:06Z","snapshot_observed_at":"2026-07-12T23:17:31.243229Z","submitted_at":"2026-05-11T17:32:29Z","title":"LoKA: Low-precision Kernel Applications for Recommendation Models At Scale","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-05-15T04:55:01.973832Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.10886"},"observation_digest":"sha256:b098e6249ddc1d9a5a18815c1da1e014200216c411a81e7a7d8e904833ab2639","observation_id":"24c07d7a-917f-4525-9f4a-a6e8f41daab1","resolution":{"observed_at":"2026-05-15T04:59:46.161338Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.17445","last_updated":"2026-05-17T13:32:29Z","snapshot_observed_at":"2026-08-02T18:04:54.369917Z","submitted_at":"2026-05-17T13:32:29Z","title":"Stellar Density Classification and Regression for CSST Multi-color Imaging Using Deep Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-19T22:45:20.080342Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.17445"},"observation_digest":"sha256:0dfc449945f69c4dede29efd90e1cc11038d991238c98cceafc975d992dcdfca","observation_id":"a67966e0-f0d0-4a54-9716-1cca3c962dcc","resolution":{"observed_at":"2026-05-19T22:47:49.892339Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.22556","last_updated":"2026-05-21T14:39:24Z","snapshot_observed_at":"2026-08-01T12:21:56.938290Z","submitted_at":"2026-05-21T14:39:24Z","title":"ImplicitTerrainV2: Wavelet-Guided Spatially Adaptive Neural Terrain Representation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T07:35:20.036470Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.22556"},"observation_digest":"sha256:ad360bd8b5d72ee8f0049a8b7115dd941ea67b61aa850c561128ecbb93948baf","observation_id":"2e9d7c9d-2b4d-4657-ae2f-11f7e058ffab","resolution":{"observed_at":"2026-05-22T07:36:14.118882Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.23727","last_updated":"2026-05-22T15:06:42Z","snapshot_observed_at":"2026-08-02T15:38:20.658151Z","submitted_at":"2026-05-22T15:06:42Z","title":"Mixed-Precision in adaptive Runge-Kutta method for large ODE systems","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-25T03:15:47.197902Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.23727"},"observation_digest":"sha256:7879d70ccc6f1ac6d6ec4b305607da48181f03be7594bac2d51b252c246e9b26","observation_id":"5e2c2028-988a-41a0-964b-254cc63f4cd3","resolution":{"observed_at":"2026-05-25T03:16:33.768190Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2605.26842","last_updated":"2026-05-26T10:56:20Z","snapshot_observed_at":"2026-08-02T04:41:45.987582Z","submitted_at":"2026-05-26T10:56:20Z","title":"MONA: Muon Optimizer with Nesterov Acceleration for Scalable Language Model Training","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-06-29T19:15:49.229099Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2605.26842"},"observation_digest":"sha256:d86d5cc81c23d512265b3c31a78bc4754b69aec08a31fa9559003957f2167347","observation_id":"5964b405-6ec4-453a-afaa-23cbf3bdea7a","resolution":{"observed_at":"2026-06-29T19:23:54.146743Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.00289","last_updated":"2026-05-29T19:21:16Z","snapshot_observed_at":"2026-07-06T23:41:01.066075Z","submitted_at":"2026-05-29T19:21:16Z","title":"Inner Product Aware Quantization: Provably Fast, Accurate, and Adaptive Algorithms","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-06-28T22:49:27.913360Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.00289"},"observation_digest":"sha256:b1c6b4ec32d65ed07cb804d199b8bc4c96dd6438be4454fe2180f56943f9224d","observation_id":"29db3841-e854-4e27-8b98-27ca3edefeb0","resolution":{"observed_at":"2026-06-28T22:52:45.430187Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.00539","last_updated":"2026-05-30T05:11:13Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T05:11:13Z","title":"GNMR: Runtime Stability Control for Low-Precision Large Language Model Training","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T18:53:47.187437Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.00539"},"observation_digest":"sha256:a11421cd8d41c14eb073a849ef3901bd73796165f9b51128d1161d5c50c5e7c4","observation_id":"150da63f-56fb-4676-b64a-bb5a14c0c766","resolution":{"observed_at":"2026-06-28T19:42:36.072794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.02565","last_updated":"2026-06-01T17:55:05Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-06-01T17:55:05Z","title":"Policy-based Foveated Imaging and Perception","version":1},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-06-28T15:23:48.688620Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.02565"},"observation_digest":"sha256:07346314936639f0eb01eb298a426b0a83ea0711963fb9088d5e686e63542781","observation_id":"5134dd75-343b-444f-be77-f5da06fb1001","resolution":{"observed_at":"2026-07-01T22:26:17.724544Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.02624","last_updated":"2026-05-29T12:12:08Z","snapshot_observed_at":"2026-07-06T23:42:58.036516Z","submitted_at":"2026-05-29T12:12:08Z","title":"TadA-Bench: A Million-Variant Benchmark for Future-Round Discovery Toward Agentic Protein Engineering","version":1},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-06-28T20:01:10.638647Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.02624"},"observation_digest":"sha256:50da378a3568152a5e768bac075fd5d9148fe1f823e8b0c7ac7def55c7b8439e","observation_id":"38ff5eb0-7ad5-4dfa-bb34-9fdd64cd500a","resolution":{"observed_at":"2026-06-28T20:12:37.857337Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.08327","last_updated":"2026-06-19T21:41:58Z","snapshot_observed_at":"2026-07-06T23:47:52.907897Z","submitted_at":"2026-06-06T20:38:42Z","title":"Chiaroscuro Attention: Spending Compute in the Dark","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-27T19:32:51.720078Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.08327"},"observation_digest":"sha256:34d25a2fa6bdfa98a78c3fd69a559959341111ee0e8b5c5c06c4def20adbe823","observation_id":"dc9c169e-8682-4f00-8801-23172c49bb18","resolution":{"observed_at":"2026-07-02T21:47:27.804773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.20299","last_updated":"2026-07-01T14:03:37Z","snapshot_observed_at":"2026-07-06T23:55:29.991442Z","submitted_at":"2026-06-18T14:35:53Z","title":"Statistical Properties of Training & Generalization","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-07-02T21:51:13.457071Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.20299"},"observation_digest":"sha256:53bf2866bbbd68993eb050941a93a4f42d73b1619d9827229e18aa80c6023964","observation_id":"45f8d090-7309-4ecd-acc6-30e13343f251","resolution":{"observed_at":"2026-07-02T21:57:25.510841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.23546","last_updated":"2026-06-22T16:18:06Z","snapshot_observed_at":"2026-07-31T11:55:11.198352Z","submitted_at":"2026-06-22T16:18:06Z","title":"The Energy Consumption of Transformer Fine-Tuning: A Roofline-Inspired Scaling Model","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-06-26T09:04:05.257526Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.23546"},"observation_digest":"sha256:3b1fe04baf38384fe6e47d3a252980fa377ba7db1c6b9565de2cfa6864d1abb9","observation_id":"4e5ef729-3e71-41d4-b37c-85e7220b02b9","resolution":{"observed_at":"2026-07-04T10:09:45.436537Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2606.29723","last_updated":"2026-06-29T03:00:54Z","snapshot_observed_at":"2026-08-06T06:52:36.692407Z","submitted_at":"2026-06-29T03:00:54Z","title":"ScaleAware-JEPA: Latent Representation for Discovery in Multiscale Physical Fields","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-06-30T07:47:27.281103Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2606.29723"},"observation_digest":"sha256:cef9994a15edee220824d395e06b7a23a5a6afa4052b7f1ed5c750e91fb844b9","observation_id":"6d476fc7-d45b-4737-acc4-e11c8efb6dc5","resolution":{"observed_at":"2026-06-30T07:54:21.534374Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":1},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-07T23:59:38.702609Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:7a267a5f3a393bfeaa39610ee5d58dfe930be7d85f268f8bc0f72c59b851fa9a","observation_id":"8e0a6df9-c8d3-42b3-b899-f167f0b930a8","resolution":{"observed_at":"2026-07-08T00:04:22.604659Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-11T07:46:49.059192Z","title":"arXiv preprint arXiv:1710.03740 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05196","last_updated":"2026-07-07T15:36:48Z","snapshot_observed_at":"2026-07-11T07:46:45.098798Z","submitted_at":"2026-07-06T15:11:57Z","title":"Unified Audio Intelligence Without Regressing on Text Intelligence","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-07-11T07:46:49.059192Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.05196"},"observation_digest":"sha256:a0dfdffbe2c0825316c928022ec67ceb279ed1675d1c358e14bcbcae400041dd","observation_id":"13a381f6-3310-419d-9227-59f085a4a8c9","resolution":{"observed_at":"2026-07-11T07:46:49.059192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2607.06105","last_updated":"2026-07-07T10:16:31Z","snapshot_observed_at":"2026-08-06T11:02:20.421579Z","submitted_at":"2026-07-07T10:16:31Z","title":"EcoVision: AI-Powered Drone Imaging for Salt Marsh Vegetation Monitoring and Dominance Mapping","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-08T16:36:22.647176Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.06105"},"observation_digest":"sha256:7571bb257d9544bf10a073e17d363f4ebc20946287af5235cd865dac1f768511","observation_id":"74d9f99b-1533-4396-8b9c-b7ac870672df","resolution":{"observed_at":"2026-07-08T16:45:07.435795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2607.07494","last_updated":"2026-07-08T14:55:51Z","snapshot_observed_at":"2026-08-06T14:19:09.043160Z","submitted_at":"2026-07-08T14:55:51Z","title":"GIFT: Geometry-Informed Low-precision Gradient Communication for LLM Pretraining","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-09T09:15:12.214083Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.07494"},"observation_digest":"sha256:a5e6f092f39d5f5a6454597f51dcf421d675d3ef372845e8e7fffafef2cb79c2","observation_id":"75ae97cc-eea2-4299-99a6-6ba24ebfe5e2","resolution":{"observed_at":"2026-07-09T09:16:06.471623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":"1710.03740","doi":"10.48550/arxiv.1710.03740","metadata_source":"pith","pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixed Precision Training","venue":"cs.AI","work_id":"c525941b-ce20-4bcb-8509-a9968f1e89c3","year":2017},"citing_paper":{"arxiv_id":"2607.07683","last_updated":"2026-07-08T17:42:00Z","snapshot_observed_at":"2026-08-01T21:08:08.729050Z","submitted_at":"2026-07-08T17:42:00Z","title":"ECGLight: Compute-Light Framework For Paper ECG Digitization and Myocardial Infarction Screening","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-09T02:52:36.673562Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.07683"},"observation_digest":"sha256:d12e56de59a5ff48e6c8b4cce8d7f839d9fdf8d644d9b42f586997e2d00a776c","observation_id":"a12530ed-3fca-4d3b-82c3-988d908a6ca4","resolution":{"observed_at":"2026-07-09T02:55:53.489282Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:36.073032+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-07-14T15:32:26.691504Z","title":"Mixed precision training,","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.09800","last_updated":"2026-07-28T02:32:08Z","snapshot_observed_at":"2026-08-02T07:54:44.716900Z","submitted_at":"2026-07-09T15:23:42Z","title":"Reference Traces for Auditing Invisible Weight Updates and Guiding Exact-Budget Protection","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T15:32:26.691504Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.09800"},"observation_digest":"sha256:6f8d606eaa819e2c6c97f149803e16a996ba88472b1317c2945df89fb9a4e9a4","observation_id":"a54af58d-c298-44ac-ad08-985208801cf1","resolution":{"observed_at":"2026-07-14T15:32:26.691504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-02T01:01:53.915589Z","title":"arXiv preprint arXiv:1710.03740 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16339","last_updated":"2026-07-22T03:14:53Z","snapshot_observed_at":"2026-08-05T20:30:33.875107Z","submitted_at":"2026-07-16T10:49:15Z","title":"LaCache: Exact Caching and Precision-Adaptive Inference for Diffusion Large Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-02T01:01:53.915589Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.16339"},"observation_digest":"sha256:d25a48410d6d913596eb1620a286fb9a604ee78ab2801e018953c741a584416d","observation_id":"c2f05478-a164-4b8d-acb9-ce93f4bc828a","resolution":{"observed_at":"2026-08-02T01:01:53.915589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-01T17:12:30.460917Z","title":"arXiv:1710.03740 [cs, stat] , author =","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.17733","last_updated":"2026-07-20T09:23:10Z","snapshot_observed_at":"2026-08-06T08:12:52.802637Z","submitted_at":"2026-07-20T09:23:10Z","title":"MXSens: Sensitivity-Aware Mixed-Precision Quantization for Efficient LLM Inference","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-01T17:12:30.460917Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.17733"},"observation_digest":"sha256:330f7104b7bc39ef53cfe65b385078a498f221cd292a2049781baef278e97f8e","observation_id":"1e7a4a44-a773-460e-928b-ad3ba0d012ae","resolution":{"observed_at":"2026-08-01T17:12:30.460917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-01T14:34:14.682480Z","title":"net/forum?id=r1gs9JgRZ","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.18758","last_updated":"2026-07-21T06:27:43Z","snapshot_observed_at":"2026-08-06T02:41:49.878457Z","submitted_at":"2026-07-21T06:27:43Z","title":"A Second-Moment Theory for Floating-Point Reduction Trees","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-01T14:34:14.682480Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.18758"},"observation_digest":"sha256:092e9e594b4081e2655a6e0a420ca8a2b3a265b6d553770243a46c69bb134d8b","observation_id":"da1f1e15-de38-43c3-8aee-5f7326601c8b","resolution":{"observed_at":"2026-08-01T14:34:14.682480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-01T12:31:08.382963Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.19539","last_updated":"2026-07-21T19:40:06Z","snapshot_observed_at":"2026-08-06T12:33:17.033869Z","submitted_at":"2026-07-21T19:40:06Z","title":"Fine-grained Computation-Communication Overlap via Tile-level Signaling and Scheduling for Mixture-of-Experts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T12:31:08.382963Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2607.19539"},"observation_digest":"sha256:20c136dbd26a90377a51fabed15e1855987c1b63e01ca76ac98aeea642af5768","observation_id":"6a8fb7aa-49da-43be-b952-406da9b2abcc","resolution":{"observed_at":"2026-08-01T12:31:08.382963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1710.03740","snapshot_observed_at":"2026-08-04T15:20:16.141469Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02091","last_updated":"2026-08-03T11:50:06Z","snapshot_observed_at":"2026-08-06T19:29:46.491901Z","submitted_at":"2026-08-03T11:50:06Z","title":"One QK Channel, Many Sources: Guarding Low-Precision Attention Collapse","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-04T15:20:16.141469Z"},"links":{"cited_paper":"/paper/1710.03740","citing_paper":"/paper/2608.02091"},"observation_digest":"sha256:baa419174aeb64c392aff7321a082e58cbdf84ee6a4c4600d82b82596d74b0f1","observation_id":"ccce5e19-0bc5-4f1c-b6b5-ee1b7c407119","resolution":{"observed_at":"2026-08-04T15:20:16.141469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/1710.03740/citation-record","integrity":"/paper/1710.03740/integrity","json":"/paper/1710.03740/citation-record.json","paper":"/paper/1710.03740"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Amodei, R","venue":null,"work_id":"4b2e0467-fb94-4cf3-81bf-6653c501e82b","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:85ebf9d6826cbe75d60ae9e6b8d45583c6ce7b64b6b5e744c532bd16c8407198","observation_id":"8311298c-8d48-4159-84af-38df4c03bfdf","resolution":{"observed_at":"2026-05-12T10:47:18.631923Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1406.1078","last_updated":"2014-09-03T00:25:02Z","snapshot_observed_at":"2026-07-06T03:45:28.546418Z","submitted_at":"2014-06-03T17:47:08Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","version":3},"cited_work":{"arxiv_id":"1406.1078","doi":"10.48550/arxiv.1406.1078","metadata_source":"pith","pith_arxiv_id":"1406.1078","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Learning Phrase Representations using RNN Encoder-Decoder for Statistical Machine Translation","venue":"cs.CL","work_id":"af085a26-bb72-4b1a-8e38-107776555081","year":2014},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1406.1078","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:160dc57d7eba55b8b237ad25b06de99f3dce62aaa68b58770fd4b3cb57c1e002","observation_id":"63a1babe-77d6-4a82-9f7d-bb2d8441973a","resolution":{"observed_at":"2026-05-12T23:34:11.077671Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:34.843836+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:34.843836+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Courbariaux, Y","venue":null,"work_id":"db9fa2d5-df87-4093-b0b3-ac2811cf949b","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:aa7eb3e5d2f1099a83018acfab44a5da4583c3d3a8fab7a04e7ece94008a4293","observation_id":"78454509-f060-4353-b1e8-c269f3108c6d","resolution":{"observed_at":"2026-05-12T10:47:18.584854Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Girshick","venue":null,"work_id":"6ca2a409-213c-4721-9195-0e8ccda6dc60","year":null},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:82a3e1dc4af1f09466d7cd364bafcc65afa12ebf98779a7f2a05159c7042ce60","observation_id":"e383cb6c-1e17-46f5-8da2-190e8b37ac51","resolution":{"observed_at":"2026-05-12T10:47:18.589833Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tensorflow tutorial: Sequence-to-sequence models","venue":null,"work_id":"a17f39a6-a37e-4a99-87ac-82521f061889","year":null},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:01b0e1a3582b25be49228008d966534b33a873fbedd858056609d68a87abf3e1","observation_id":"1ed0d99e-7ff2-45e6-82c3-4753d2d1f7cc","resolution":{"observed_at":"2026-05-12T10:47:18.594657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Graves, S","venue":null,"work_id":"e810dc2c-3e95-401b-b749-2889a75fdead","year":2006},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:e761f1140cd618eda717ab89293718f55d05a489fbb4221e09fe0db8897e10b5","observation_id":"36859682-cdce-427a-8e7b-0d0d638dc8a6","resolution":{"observed_at":"2026-05-12T10:47:18.599595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gupta, A","venue":null,"work_id":"f2544af2-9ba2-4626-ae2d-e08407f9e80f","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:4c351b53d8adf7d6dd11af0e20942f1c64664c951e65e14b442aae2ccb3e73fb","observation_id":"69f467fe-d435-4a7a-b612-35fcedb4ba97","resolution":{"observed_at":"2026-05-12T10:47:18.604580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.5567","last_updated":"2014-12-19T21:36:13Z","snapshot_observed_at":"2026-07-06T04:03:56.251710Z","submitted_at":"2014-12-17T20:39:45Z","title":"Deep Speech: Scaling up end-to-end speech recognition","version":2},"cited_work":{"arxiv_id":"1412.5567","doi":"10.48550/arxiv.1412.5567","metadata_source":"pith","pith_arxiv_id":"1412.5567","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Deep Speech: Scaling up end-to-end speech recognition","venue":"cs.CL","work_id":"eb57b6c8-18a7-4e51-b90a-2add68d4ee9e","year":2014},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1412.5567","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:cbebbad8d7105e68408db3628d88994a78f24340589232ef36960a7162c7d5cc","observation_id":"446fe6cf-28f0-4211-887b-4ee6cdc0b47e","resolution":{"observed_at":"2026-05-12T10:47:18.502759Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"96622aac-bd1b-414f-abda-6eaba8339943","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:3465b3b4741674e1a2a00674138e57219439b514b936c35c1f31e526c9094668","observation_id":"2a7cc35a-f081-42be-a3bc-63d25a7dec9e","resolution":{"observed_at":"2026-05-12T10:47:18.609185Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"286c8e47-8562-44b8-b19e-b94db04c7165","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:ba5fce74c11222e2bb2eaada3f6560d492cae4203535c9f3a4da9e9c34682c94","observation_id":"813046de-14a0-4e01-a6cb-96fbe2b669e4","resolution":{"observed_at":"2026-05-12T10:47:18.613625Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.10176","last_updated":"2016-11-30T14:33:08Z","snapshot_observed_at":"2026-07-06T05:20:45.882004Z","submitted_at":"2016-11-30T14:33:08Z","title":"Effective Quantization Methods for Recurrent Neural Networks","version":1},"cited_work":{"arxiv_id":"1611.10176","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.10176","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Effective Quantization Methods for Recurrent Neural Networks","venue":"cs.LG","work_id":"4a4c361e-c47a-48d9-ad19-80e85cf3d1fb","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1611.10176","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:ca0c6ad2b5dabe7171a23971fe883b6fac521617ec293088a6c5f2c2ee37da97","observation_id":"fb32e13a-b0a2-40e5-8fa1-bc5dfe03667a","resolution":{"observed_at":"2026-05-12T10:47:18.555032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"gov/9377276","doi":"10.1162/neco.1997.9.8.1735","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Long short -term memory","venue":"Neural Computation","work_id":"c3b0bfa7-6764-45f1-a40d-45baaee9d22c","year":1997},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:253862062d7b2fd472d841521f5f7077add9f346e0a7d0b0e0a1ec6e094cd7f0","observation_id":"5e00639a-6590-4ac3-8d7e-59eee4875ffa","resolution":{"observed_at":"2026-05-12T10:47:18.471996Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-11T06:49:14.059619+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T06:49:14.059619+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hubara, M","venue":null,"work_id":"c9370978-1ddf-4a90-b4ea-17a83c7c535a","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:86b0cf496b6d9c605aefbac4056f9341d917cbe9f92e67543cfb77b64cdce807","observation_id":"db0b8704-b19d-4534-8580-ab2d3bffc1d7","resolution":{"observed_at":"2026-05-12T10:47:18.618998Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07061","last_updated":"2016-09-22T16:48:03Z","snapshot_observed_at":"2026-07-06T05:11:50.145502Z","submitted_at":"2016-09-22T16:48:03Z","title":"Quantized Neural Networks: Training Neural Networks with Low Precision Weights and Activations","version":1},"cited_work":{"arxiv_id":"1609.07061","doi":"10.48550/arxiv.1609.07061","metadata_source":"pith","pith_arxiv_id":"1609.07061","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantized Neural Networks: Training Neural Networks with Low Precision Weights and Activations","venue":"cs.NE","work_id":"ecdf87ee-5847-49b3-b239-59dad63c30a5","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1609.07061","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:631804fd55886476fe60469d259d2bfe00d52e95126b2aead2eb7214951b7b40","observation_id":"c8008e1c-343e-4a5a-a9c0-7e557a4c2420","resolution":{"observed_at":"2026-05-12T10:47:18.487769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ioffe and C","venue":null,"work_id":"539d1f07-1b46-4829-a627-2b874ac4641f","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:e941c229b0712ebe1a950e9bd7be7bb90ee5b4cdabf48c49a3c43d983f797825","observation_id":"728b12f1-ee42-4b2b-a5c2-5d67e2806c9a","resolution":{"observed_at":"2026-05-12T10:47:18.624144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1408.5093","last_updated":"2014-06-20T23:00:32Z","snapshot_observed_at":"2026-07-06T03:52:20.144979Z","submitted_at":"2014-06-20T23:00:32Z","title":"Caffe: Convolutional Architecture for Fast Feature Embedding","version":1},"cited_work":{"arxiv_id":"1408.5093","doi":null,"metadata_source":"pith","pith_arxiv_id":"1408.5093","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Caffe: Convolutional Architecture for Fast Feature Embedding","venue":"cs.CV","work_id":"237de0db-0556-4b65-b014-bb29418efc91","year":2014},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1408.5093","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:b58107ffed2b55a0e5d4ab84287ad0e0412c195c9922d44f2a65cec94cb78e8f","observation_id":"90085eb1-a85a-4abe-b87d-05e96de45d8f","resolution":{"observed_at":"2026-05-12T10:47:18.517408Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-07-06T04:45:24.152472Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:c8500b02bb003243296dc02a6a2cfb8bed94bc79f8089d4d2d2bec43596c274d","observation_id":"d5f7e111-5d01-42eb-ad92-449d8bd5eb34","resolution":{"observed_at":"2026-05-12T10:47:18.539963Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Krizhevsky, I","venue":null,"work_id":"d64fcdcd-a531-4f54-b5dc-5b4649291045","year":2012},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:39e46993ea80be5ae548fb66afd6db024d97a36b592c035f1f1546158034868c","observation_id":"6bdfcc33-ecbb-487c-bec8-4ae9874a87f4","resolution":{"observed_at":"2026-05-12T10:47:18.580126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a5bce27-78b6-4871-8708-e04bd15295de","year":null},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:48f24123b17141ff4f0922f80f976ac9053ec03707a99080da635495c4ec6dbf","observation_id":"030f9d65-067f-4aba-a78d-6ae100c337c4","resolution":{"observed_at":"2026-05-12T10:47:18.638448Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1512.02325","last_updated":"2016-12-29T19:05:11Z","snapshot_observed_at":"2026-07-06T04:39:05.325036Z","submitted_at":"2015-12-08T04:46:38Z","title":"SSD: Single Shot MultiBox Detector","version":5},"cited_work":{"arxiv_id":"1512.02325","doi":"10.48550/arxiv.1512.02325","metadata_source":"pith","pith_arxiv_id":"1512.02325","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"SSD: Single Shot MultiBox Detector","venue":"cs.CV","work_id":"a12eb32e-0c5e-4662-8a97-3fb48e53cf7d","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1512.02325","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:374cebb67cfc8e1c738c0a083b12063d3b71e2706ed4a84f73c2c245d82534ec","observation_id":"b6aeded3-2a8c-4f0f-9954-7302922f9a21","resolution":{"observed_at":"2026-05-12T10:47:18.568260Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"73ac7f78-6f74-4879-bac8-f9ec7ea6689f","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:7bcd2a7898e36ffac80f0ba2a3b77175fa387a86079037668782bb565dcfdb75","observation_id":"87ddd323-7110-498d-b9ac-b8ce9768067b","resolution":{"observed_at":"2026-05-12T10:47:18.643879Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1709.01134","last_updated":"2017-09-04T19:56:48Z","snapshot_observed_at":"2026-08-02T02:00:33.789524Z","submitted_at":"2017-09-04T19:56:48Z","title":"WRPN: Wide Reduced-Precision Networks","version":1},"cited_work":{"arxiv_id":"1709.01134","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1709.01134","snapshot_observed_at":"2026-07-04T22:11:02.203150Z","title":"Mishra, E","venue":null,"work_id":"381ab3fb-2868-4d02-89ac-73d8a0e4797b","year":2017},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1709.01134","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:fc5e0601b7997829bed73b7cc4c6d6c953c9bdadd064cfa66aa5e99348827572","observation_id":"d029a6d1-51ed-4783-b7e0-105bf28d6fbb","resolution":{"observed_at":"2026-07-04T22:11:02.203150Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Nvidia tesla v100 gpu architecture","venue":null,"work_id":"67a1613d-c7b3-4fa6-b091-c8a39371741b","year":2017},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:37b20b0e208779e503e0b4b0fe6592802725b304af06d1ca8c5cd78062eb5f20","observation_id":"92e2eda1-514c-4aaa-8dfd-b85708f93fe0","resolution":{"observed_at":"2026-05-12T10:47:18.649702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1608.06902","last_updated":"2017-02-26T14:01:40Z","snapshot_observed_at":"2026-07-06T05:08:01.620233Z","submitted_at":"2016-08-24T17:15:29Z","title":"Recurrent Neural Networks With Limited Numerical Precision","version":2},"cited_work":{"arxiv_id":"1608.06902","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1608.06902","snapshot_observed_at":"2026-07-04T21:47:21.164964Z","title":null,"venue":null,"work_id":"bd261e5e-058a-4802-ae3f-8033cabb132b","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1608.06902","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:b4f1c401eda146efd196888ca0e55579926bde380cb81ba43fa6b751e7f4a3d8","observation_id":"d8282278-da30-4473-962b-b5100d43f126","resolution":{"observed_at":"2026-07-04T21:47:21.164964Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paszke, S","venue":null,"work_id":"b6a5d760-ec72-4a07-b201-269e55a52e5e","year":2017},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:8428777db39e42667beea16601bc92171413f62277b47ed624943d1d9df59332","observation_id":"a3669972-2cde-43d7-82c5-cec19871bdc7","resolution":{"observed_at":"2026-05-12T10:47:18.663080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1511.06434","last_updated":"2016-01-07T23:09:39Z","snapshot_observed_at":"2026-08-04T04:34:27.861448Z","submitted_at":"2015-11-19T22:50:32Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","version":2},"cited_work":{"arxiv_id":"1511.06434","doi":"10.48550/arxiv.1511.06434","metadata_source":"pith","pith_arxiv_id":"1511.06434","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Unsupervised Representation Learning with Deep Convolutional Generative Adversarial Networks","venue":"cs.LG","work_id":"fe2c86f4-daa0-4e36-b130-d09d98afa55a","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1511.06434","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:7975fd093e6e03a224784495f4366a4573bcdd80633c194c457bdb1030fb9881","observation_id":"4e119def-e760-4a7a-ab15-05290e30f0ff","resolution":{"observed_at":"2026-05-13T16:44:09.291693Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-319-46493-0_32","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Rastegari, V","venue":"Lecture notes in computer science","work_id":"e44325fe-6249-4bb9-9890-444e71df6299","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:bfe61e5b97ff7144ba0c4c44fd83c7db7d29dfc75dd4bb22f8abd303fe544c5a","observation_id":"5d1453df-98c1-4a65-afc8-b22e9f0c5f8c","resolution":{"observed_at":"2026-05-12T10:47:18.465559Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-20T21:22:07.379794+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-20T21:22:07.379794+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"35cf7f36-ac05-42da-a89a-2b65f3a3f8a5","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:73b6b5e5733b5df60fcd2482bd547c465452619a8b4d0f6d410cdcfba88f1f57","observation_id":"cddd7d15-2a70-4fa1-8830-3938bfe9d437","resolution":{"observed_at":"2026-05-12T10:47:18.668855Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/s11263-015-0816-y","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T06:34:18.332950Z","title":"ImageNet Large Scale Visual Recognition Challenge","venue":"International Journal of Computer Vision","work_id":"5fa65a50-c437-40cd-bd09-3ae031477803","year":2015},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:b36cf69309f85a74175b61fcd3ae94eb4611775958eaf2c2044b9bda20c410ae","observation_id":"d97f8290-54fa-4229-bf3b-dfaf4a61eebc","resolution":{"observed_at":"2026-05-12T10:47:18.459783Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T12:50:01.687181+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T12:50:01.687181+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":"1409.1556","doi":"10.48550/arxiv.1409.1556","metadata_source":"pith","pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","venue":"cs.CV","work_id":"1c4b4409-c14b-488b-a086-c57a5aab8a29","year":2014},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:51cd0a34651363de72207e4e7f5879796c0f5dcd72a3b45c0c589658e0aaa942","observation_id":"53135387-5f2f-49c1-92e6-a5b9a626eb5c","resolution":{"observed_at":"2026-05-12T10:47:18.524841Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T23:51:07.915518+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.4842","last_updated":"2014-09-17T01:03:11Z","snapshot_observed_at":"2026-07-06T03:54:42.722883Z","submitted_at":"2014-09-17T01:03:11Z","title":"Going Deeper with Convolutions","version":1},"cited_work":{"arxiv_id":"1409.4842","doi":"10.48550/arxiv.1409.4842","metadata_source":"pith","pith_arxiv_id":"1409.4842","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Going Deeper with Convolutions","venue":"cs.CV","work_id":"bfbafb27-ff94-46ae-98e9-35389fe858b6","year":2014},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1409.4842","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:649c7e1a167eb3bf40cdb6ef33f71fdad95f92020804328bd5b184503693fbd0","observation_id":"2a3ad918-75a7-4806-9748-4afcc5617ab7","resolution":{"observed_at":"2026-05-12T10:47:18.532210Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Szegedy, V","venue":null,"work_id":"14d4bedf-2c47-42f1-a785-a5c745826abc","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:b6a893c2cc0b02469da1b1223cced9ae86da76d547062bb306c31e5d2c16db31","observation_id":"48a223de-06ac-4548-b3f2-85e1377911f0","resolution":{"observed_at":"2026-05-12T10:47:18.674946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1609.08144","last_updated":"2016-10-08T19:10:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-09-26T19:59:55Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","version":2},"cited_work":{"arxiv_id":"1609.08144","doi":"10.18653/v1/2021.eacl-main.163","metadata_source":"pith","pith_arxiv_id":"1609.08144","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Google's Neural Machine Translation System: Bridging the Gap between Human and Machine Translation","venue":"cs.CL","work_id":"e294e5a1-5dd2-44a0-b348-adbd62fe1916","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1609.08144","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:4f21764998864f600841e4080662e17e56a3e62220f6770c5e39c9b6d30f4ebe","observation_id":"6dc7ff70-de1f-407e-b9fd-64eebf666647","resolution":{"observed_at":"2026-05-12T15:21:29.028955Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1606.06160","last_updated":"2018-02-02T01:43:54Z","snapshot_observed_at":"2026-07-06T05:00:35.763958Z","submitted_at":"2016-06-20T15:02:31Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients","version":3},"cited_work":{"arxiv_id":"1606.06160","doi":"10.48550/arxiv.1606.06160","metadata_source":"pith","pith_arxiv_id":"1606.06160","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DoReFa-Net: Training Low Bitwidth Convolutional Neural Networks with Low Bitwidth Gradients","venue":"cs.NE","work_id":"ff82bd1e-0b64-4426-81a0-91594dba0a20","year":2016},"citing_paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-12T10:47:18.426912Z"},"links":{"cited_paper":"/paper/1606.06160","citing_paper":"/paper/1710.03740"},"observation_digest":"sha256:13f2ee59aa3b359c63e1e5bf424143d582c03f3f1808a3a7014a96dcfae0bd1c","observation_id":"5b1b4621-c172-46fa-bb21-3a6f8e4d67e7","resolution":{"observed_at":"2026-05-12T10:47:18.561797Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-06T06:34:29.942622+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"1710.03740","last_updated":"2018-02-15T20:04:02Z","latest_version":3,"primary_category":"cs.AI","snapshot_observed_at":"2026-07-06T06:03:37.247241Z","submitted_at":"2017-10-10T17:42:04Z","title":"Mixed Precision Training"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":5,"verified_exact":17,"verified_fuzzy":12},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-06T06:34:29.942622+00:00","source":"crossref"},{"observed_at":"2026-08-06T06:34:23.284952+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 91 inbound Pith citation observations for arXiv:1710.03740."}