{"as_of":"2026-08-16T15:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:365c8978c6f8e4eccd5fdb4b35e7accde4083a99698434fdc8e25220b10c22eb","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T21:03:33.493241Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.11170/citation-record","integrity":"/paper/2505.11170/integrity","json":"/paper/2505.11170/citation-record.json","paper":"/paper/2505.11170"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-14T04:51:04.817737Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-15T21:03:32.448608Z","title":"Bengio, N","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.448608Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:28b42b45a6063794fcf51dacdbfa143abd8dabaeeb6813697064753f8bd8d887","observation_id":"b24e17d4-2469-4faa-8d8a-ad8e2f6227b8","resolution":{"observed_at":"2026-08-15T21:03:32.448608Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:32.497412Z","title":null,"venue":null,"work_id":null,"year":1958},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.497412Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:e9721669b7738786ef6eb88191cda076a1325e54ce73e046f80476f7fe4dbcbf","observation_id":"efdd9ad8-b5b6-4235-bb41-1a2f43501eee","resolution":{"observed_at":"2026-08-15T21:03:32.497412Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:35.483207Z","title":null,"venue":null,"work_id":"7b53b27f-37f9-4fac-b659-2da702ac6406","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.535194Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:b26e8fb1ba142c77388fefd27b301e9000c2e1f772f043a9cffc181c7ab67bf3","observation_id":"b751dc2e-5131-4adf-886b-87038ba35c1d","resolution":{"observed_at":"2026-08-15T21:03:35.489525Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-08-15T17:27:11.980940Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-15T21:03:32.545119Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.545119Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:096e4629027858430d5276475580ab9a81a8bffb6ca38b5bac8f0d012d20580b","observation_id":"e67f9951-c2c3-4e79-9777-74fb7ab18f3d","resolution":{"observed_at":"2026-08-15T21:03:32.545119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-15T21:03:32.625086Z","title":"Dettmers, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.625086Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:8a342a3fb9e471fa2cb54194feaf58abecb8493d8a1b9188d7a18a6c8783cf7b","observation_id":"c6642a4b-277f-4368-b61d-a03158543476","resolution":{"observed_at":"2026-08-15T21:03:32.625086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09987","last_updated":"2022-10-17T13:29:01Z","snapshot_observed_at":"2026-08-13T19:36:52.103359Z","submitted_at":"2021-04-20T14:14:03Z","title":"Differentiable Model Compression via Pseudo Quantization Noise","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09987","snapshot_observed_at":"2026-08-15T21:03:32.720775Z","title":"Défossez, Y","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.720775Z"},"links":{"cited_paper":"/paper/2104.09987","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:a3260ff3594b22c8c0d41f99771cf0232235735ad494d7c943667e65c4f12427","observation_id":"a6cb5fac-382e-4848-a08a-d79d49983cce","resolution":{"observed_at":"2026-08-15T21:03:32.720775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:35.348393Z","title":"Fishman, B","venue":null,"work_id":"aa30febf-a58b-419a-8d24-ef0d5b0192fe","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.753058Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:27c56c167f5c0232d2bfe97c20e23463e6f46495ef153a968c9e1501a8e483ac","observation_id":"b5a8f183-e0f0-4b36-9ee2-dea5f2df68ef","resolution":{"observed_at":"2026-08-15T21:03:35.430815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:32.764394Z","title":"Gokaslan and V","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.764394Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:ac59b0b28713ef51e8fd48d1b3ab17d59598c0a2d3e7b76b7ff0f0339c989520","observation_id":"96f18cd5-8f46-47f8-81df-f316f4d8a023","resolution":{"observed_at":"2026-08-15T21:03:32.764394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12517","last_updated":"2025-02-10T09:37:59Z","snapshot_observed_at":"2026-08-16T13:17:16.331916Z","submitted_at":"2024-09-19T07:15:58Z","title":"Scaling FP8 training to trillion-token LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12517","snapshot_observed_at":"2026-08-15T21:03:32.759252Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.759252Z"},"links":{"cited_paper":"/paper/2409.12517","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:3d719579fed2c1a936cf80d92601f86a7fc40ddb736cb4246e5f913503f4ba90","observation_id":"b4e070fd-686e-400f-b9d1-a0231fd220cb","resolution":{"observed_at":"2026-08-15T21:03:32.759252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-15T21:03:32.778287Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.778287Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:a51d4867f7b8a7b30b41e2c1f2deeb8d2990684fbdbbfee49403606e69ab468a","observation_id":"475da16d-741f-44d7-bd3f-2534cc503b89","resolution":{"observed_at":"2026-08-15T21:03:32.778287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:35.325747Z","title":"Grattafiori, A","venue":null,"work_id":"9cb7cd1b-462a-401a-90d0-a3503c55f1f6","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.769209Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:1d27150663a85f3e0d7342c76a7718c1d3a545495a9484d548b583eca9322069","observation_id":"c74e4fb3-3e5e-4835-8e5c-2c535a1bdc85","resolution":{"observed_at":"2026-08-15T21:03:35.329749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04330","last_updated":"2024-11-30T02:42:31Z","snapshot_observed_at":"2026-08-16T13:02:16.371412Z","submitted_at":"2024-11-07T00:10:10Z","title":"Scaling Laws for Precision","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04330","snapshot_observed_at":"2026-08-15T21:03:32.870353Z","title":"Kumar, Z","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.870353Z"},"links":{"cited_paper":"/paper/2411.04330","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:c5edc4a6380d2ccf10a5ffd651a86557e92a2c4486e776c912c2366a9df07d15","observation_id":"051c004b-2ccf-4e4c-af6b-4ad66df82042","resolution":{"observed_at":"2026-08-15T21:03:32.870353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:32.923169Z","title":"Lathrop, J","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.923169Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:5f84b34c14649f9c886624dd072478ae15ab56b6e4884bf7e344b41ddfce750f","observation_id":"b3ab9dc9-bc95-4e52-83a1-d7300cf14dd3","resolution":{"observed_at":"2026-08-15T21:03:32.923169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:35.176850Z","title":"Karpathy","venue":null,"work_id":"c7ae3e00-67d5-49ae-89db-4fd20ded35c4","year":2022},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.782785Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:50a96dfb7e0087651d1301a6c989ca95f0dcd8ebee08cf4c0fdf5d96747b829c","observation_id":"498874f9-5005-436d-ade0-7916f8db51ea","resolution":{"observed_at":"2026-08-15T21:03:35.316157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16528","last_updated":"2024-11-04T09:50:00Z","snapshot_observed_at":"2026-08-16T13:49:20.499813Z","submitted_at":"2024-05-26T11:29:57Z","title":"LoQT: Low-Rank Adapters for Quantized Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16528","snapshot_observed_at":"2026-08-15T21:03:32.932775Z","title":"Loeschcke, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.932775Z"},"links":{"cited_paper":"/paper/2405.16528","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:f0675a5cc9ccc3b59e976dc21151d3b5698125343c77f8f925b4225ff8dcf5f0","observation_id":"c0254d16-b418-4411-8460-b304a842bd8c","resolution":{"observed_at":"2026-08-15T21:03:32.932775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-15T21:03:32.938904Z","title":"Loshchilov and F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.938904Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:27ba13432c70071a0674089401c89d686fcb0df2ab93eae4f7384d182bc8d0c4","observation_id":"40acfe93-ad51-4f19-aab1-5886b936fe7b","resolution":{"observed_at":"2026-08-15T21:03:32.938904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.923025Z","title":"Liang, T","venue":null,"work_id":"d1bd6814-c827-4df4-b37f-90d4a992783f","year":2024},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.928274Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:00e7bb1b5760e4c05e6c4aa4e9087590f27060eb627503faf98a105759dd65c5","observation_id":"fb0eb90c-e313-4ecf-bad4-93465fc17fde","resolution":{"observed_at":"2026-08-15T21:03:35.067582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.05433","last_updated":"2022-09-29T20:47:07Z","snapshot_observed_at":"2026-08-14T05:39:52.416140Z","submitted_at":"2022-09-12T17:39:55Z","title":"FP8 Formats for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.05433","snapshot_observed_at":"2026-08-15T21:03:32.947823Z","title":"Micikevicius, D","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.947823Z"},"links":{"cited_paper":"/paper/2209.05433","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:10e17ba0f69deefc710bb44dad1c06ece4203b26a9079719e26c86465fd33316","observation_id":"46da2d5c-9e2a-4843-bd5a-8a850c644903","resolution":{"observed_at":"2026-08-15T21:03:32.947823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.907391Z","title":null,"venue":null,"work_id":"74ee9ad8-cf58-41af-9cc2-c8cc56cdebbb","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.986419Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:05c20a08d0c3c87ead44cfd0eb4af76056a55436005d683292cd352f1f020381","observation_id":"daa154e5-fb81-4f98-adf0-dc08598de893","resolution":{"observed_at":"2026-08-15T21:03:34.912299Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:32.943560Z","title":"Mattson, A","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.943560Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:56af7f01296db99ca1bd192ea8060cf7e118a813c93d424824aa9167400ad722","observation_id":"04a38b16-0343-44d7-a8a8-20864c665624","resolution":{"observed_at":"2026-08-15T21:03:32.943560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.686905Z","title":"Radford, J","venue":null,"work_id":"af454f2a-75c9-4a6e-b411-90a8c578539b","year":2019},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.093988Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:0a8aac2d690631e9d35c3d0c7f1f5c92f795e3ad35a62bc3e56598ea3166433f","observation_id":"7e510fbb-8dc6-4296-bec9-20dc97dec309","resolution":{"observed_at":"2026-08-15T21:03:34.750563Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.670417Z","title":"Raffel, N","venue":null,"work_id":"44ab9bbb-a9b8-43de-bb1a-89b701fa24e1","year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.098072Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:470d8ca0d93a0e7b4b8a5bbd882b235c23811a8d9befe86b4ac64351065f3d0f","observation_id":"a7887ba7-5f70-4b29-85a6-4891398e6f57","resolution":{"observed_at":"2026-08-15T21:03:34.676654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-15T21:03:33.102803Z","title":"Rajbhandari, J","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.102803Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:bdc3ac13f483f34b234a1a3930d8307da1658ecf6eaa66e589f7796c43dbd276","observation_id":"d392c9fd-3866-4b21-b058-c4e2327980a3","resolution":{"observed_at":"2026-08-15T21:03:33.102803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.893309Z","title":null,"venue":null,"work_id":"2e749960-befc-432d-9eaa-8a3766943887","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.083978Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:be61f07d0993f3241083addcf675d4a149929de92d83e9e463cbd3c9295689e1","observation_id":"3a2ddcd4-7abc-43ac-9641-174024e2ac93","resolution":{"observed_at":"2026-08-15T21:03:34.898709Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.00820","last_updated":"2023-07-01T08:27:18Z","snapshot_observed_at":"2026-08-13T15:32:01.875877Z","submitted_at":"2022-06-02T01:17:40Z","title":"NIPQ: Noise proxy-based Integrated Pseudo-Quantization","version":2},"cited_work":{"arxiv_id":"2206.00820","doi":null,"metadata_source":"pith","pith_arxiv_id":"2206.00820","snapshot_observed_at":"2026-08-15T21:03:33.985505Z","title":"NIPQ: Noise proxy-based Integrated Pseudo-Quantization","venue":"cs.LG","work_id":"671d6e5e-2886-4433-a7c5-bcdad2f06818","year":2022},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.112696Z"},"links":{"cited_paper":"/paper/2206.00820","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:c13453939aa5b0bca965f3470076a5c8d7400fe560b8e63b519862d2caa9a64b","observation_id":"2d8a81f2-f62a-4cdc-9149-5ab07bcd3cdd","resolution":{"observed_at":"2026-08-15T21:03:33.994963Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T21:03:34.493551Z","title":null,"venue":null,"work_id":"0bd7837d-ea7e-4b47-9a3c-a6454773cf5f","year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.179775Z"},"links":{"citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:a5de6def62e9f0710b91ff0f33a4cd970161e325f74182cf85619a88417e6bf4","observation_id":"6a328083-1a4d-40a0-99f4-531ce6dba2c4","resolution":{"observed_at":"2026-08-15T21:03:34.626071Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-15T21:03:33.249658Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.249658Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:d23d10e712a0bffaf6638448feeeae99209d6a060aeba0df97c90c6c6b4eecbc","observation_id":"1040825b-70c1-4342-bff6-30b5523c2e0d","resolution":{"observed_at":"2026-08-15T21:03:33.249658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-15T21:03:33.254826Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.254826Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:0c29df75a9e337301eab0b65278ff7308186fad23a6245e962440afe695ed3a8","observation_id":"8c1aae26-53e6-46e7-bbda-440a8b63b9cb","resolution":{"observed_at":"2026-08-15T21:03:33.254826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10537","last_updated":"2023-10-19T16:38:33Z","snapshot_observed_at":"2026-08-16T14:51:41.930241Z","submitted_at":"2023-10-16T16:07:41Z","title":"Microscaling Data Formats for Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10537","snapshot_observed_at":"2026-08-15T21:03:33.107145Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.107145Z"},"links":{"cited_paper":"/paper/2310.10537","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:bdf6f87a44f6c4166cc8f5b93504ce0f55497a4a10eebdfa7d13ecc51a5107cb","observation_id":"6bd37c6d-4928-4491-9011-c5ec9b5cdc82","resolution":{"observed_at":"2026-08-15T21:03:33.107145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-08-16T05:25:19.960199Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-15T21:03:33.338767Z","title":"Vaswani, N","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.338767Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:1a0f152f4c6a819dbcd6a3099f8afe2aeb2de34086e010f9ba1be1e48a5b0fc9","observation_id":"b32f834b-542c-4b27-8e52-d70ffbd5326a","resolution":{"observed_at":"2026-08-15T21:03:33.338767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.17116","last_updated":"2025-05-23T09:44:25Z","snapshot_observed_at":"2026-08-11T17:00:01.375103Z","submitted_at":"2025-01-28T18:04:50Z","title":"Optimizing Large Language Model Training Using FP4 Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.17116","snapshot_observed_at":"2026-08-15T21:03:33.476691Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.476691Z"},"links":{"cited_paper":"/paper/2501.17116","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:4eaa92c9969ec3ff948f92e8649d44692d71d23364fd7a141dc3396d4535bb1f","observation_id":"d0b2eef1-50e3-45d4-a0e5-0c56a848d4bc","resolution":{"observed_at":"2026-08-15T21:03:33.476691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02423","last_updated":"2025-06-04T09:06:06Z","snapshot_observed_at":"2026-08-16T12:59:43.699471Z","submitted_at":"2025-01-05T02:30:41Z","title":"Scaling Laws for Floating Point Quantization Training","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.02423","snapshot_observed_at":"2026-08-15T21:03:33.244517Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.244517Z"},"links":{"cited_paper":"/paper/2501.02423","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:0dbceb15edd19e387685297ceff5b095bb2fb3fe3e453e84c9b9cc3031c3be21","observation_id":"326247b9-0773-43ae-b5e7-a8169aef1314","resolution":{"observed_at":"2026-08-15T21:03:33.244517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-15T21:03:33.487723Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.487723Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:bc81e03382986f6d721377ff82f2e50f8174e49ef84bdc9ba93c58f9df6424bc","observation_id":"a6b4c4d9-9ced-4b46-b4ea-99a9be05a8f7","resolution":{"observed_at":"2026-08-15T21:03:33.487723Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05270","last_updated":"2025-02-17T08:27:58Z","snapshot_observed_at":"2026-08-16T13:00:27.151052Z","submitted_at":"2024-12-06T18:55:34Z","title":"APOLLO: SGD-like Memory, AdamW-level Performance","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.05270","snapshot_observed_at":"2026-08-15T21:03:33.493241Z","title":"Datatype ˆw","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.493241Z"},"links":{"cited_paper":"/paper/2412.05270","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:4e3eaa80801e30126ee9f0acf3ad6b133a0f249acd78d058034e61a7bfec4e0d","observation_id":"b25dd6bd-35ff-4847-b463-a31567e7f612","resolution":{"observed_at":"2026-08-15T21:03:33.493241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20586","last_updated":"2025-08-26T23:08:09Z","snapshot_observed_at":"2026-08-16T12:54:28.185037Z","submitted_at":"2025-02-27T23:01:31Z","title":"Training LLMs with MXFP4","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20586","snapshot_observed_at":"2026-08-15T21:03:33.260318Z","title":"Tseng, T","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.260318Z"},"links":{"cited_paper":"/paper/2502.20586","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:b64917b35198f2de73c369601f0eaf1c7bddf7e73725cb04afdd8cb12cec17d5","observation_id":"3d4fff73-0d8f-464e-b762-f002f07774a4","resolution":{"observed_at":"2026-08-15T21:03:33.260318Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16793","last_updated":"2025-02-24T11:29:08Z","snapshot_observed_at":"2026-08-16T13:40:03.769145Z","submitted_at":"2024-06-24T16:56:41Z","title":"Adam-mini: Use Fewer Learning Rates To Gain More","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16793","snapshot_observed_at":"2026-08-15T21:03:33.482517Z","title":"Zhang, C","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.482517Z"},"links":{"cited_paper":"/paper/2406.16793","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:f001dade64236bbd78dc092a2f10a8018ba80f3c12b17c0bde7f1651c769c44e","observation_id":"b004f69f-60a0-41de-8ca3-a1f626edfa77","resolution":{"observed_at":"2026-08-15T21:03:33.482517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.11331","last_updated":"2020-02-26T07:27:05Z","snapshot_observed_at":"2026-07-06T09:00:12.600151Z","submitted_at":"2020-02-26T07:27:05Z","title":"Romu: Fast Nonlinear Pseudo-Random Number Generators Providing High Quality","version":1},"cited_work":{"arxiv_id":"2002.11331","doi":null,"metadata_source":"pith","pith_arxiv_id":"2002.11331","snapshot_observed_at":"2026-08-15T21:03:34.052729Z","title":"Romu: Fast Nonlinear Pseudo-Random Number Generators Providing High Quality","venue":"cs.DC","work_id":"1a4acedf-3fea-4ce9-bc83-072bc29ede9f","year":2020},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.039626Z"},"links":{"cited_paper":"/paper/2002.11331","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:e8928966e3d81c39009843086e1c4855c28d4f556c2cb53d2ac9092c76470e33","observation_id":"99a696e4-6776-45ce-b811-8c4c21b2b760","resolution":{"observed_at":"2026-08-15T21:03:34.103736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18313","last_updated":"2023-12-19T12:27:58Z","snapshot_observed_at":"2026-08-16T14:48:11.655051Z","submitted_at":"2023-10-27T17:59:51Z","title":"FP8-LM: Training FP8 Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18313","snapshot_observed_at":"2026-08-15T21:03:33.088734Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:33.088734Z"},"links":{"cited_paper":"/paper/2310.18313","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:e3be3a6f6fbed4a572fd1f56b1c66edf83233d72f0719219ada6d9250f47b28e","observation_id":"bb6d3808-fbf6-4c1d-acc2-5901fa13b8f7","resolution":{"observed_at":"2026-08-15T21:03:33.088734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-15T21:03:32.773330Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.773330Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:0e00264db25da7ee195c943f62fe96bda98f5f2a23701a34f3b42db279509231","observation_id":"2b285202-1292-4c21-9694-017a9f502d07","resolution":{"observed_at":"2026-08-15T21:03:32.773330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20853","last_updated":"2025-07-09T03:07:28Z","snapshot_observed_at":"2026-08-16T12:54:21.256806Z","submitted_at":"2025-02-28T08:51:55Z","title":"Oscillation-Reduced MXFP4 Training for Vision Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20853","snapshot_observed_at":"2026-08-15T21:03:32.539790Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-15T21:03:32.539790Z"},"links":{"cited_paper":"/paper/2502.20853","citing_paper":"/paper/2505.11170"},"observation_digest":"sha256:012e888f0ef2dc9cfaa7a0ca9e1ab3197adceb24b1e5ff0ed9cfdcf304071dd9","observation_id":"21271101-8f90-4a48-8a44-1dbeb2f4e247","resolution":{"observed_at":"2026-08-15T21:03:32.539790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.11170","last_updated":"2025-05-16T12:14:12Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T20:53:58.184023Z","submitted_at":"2025-05-16T12:14:12Z","title":"Gaussian Weight Sampling for Scalable, Efficient and Stable Pseudo-Quantization Training"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":31,"verified_exact":2,"verified_fuzzy":6},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.11170."}