{"as_of":"2026-08-11T13:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:702c6739691ff7fb6695682ecb4892bb2d60aec2165e192c571124bcd6b40a88","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T14:53:22.233844Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.17471/citation-record","integrity":"/paper/2605.17471/integrity","json":"/paper/2605.17471/citation-record.json","paper":"/paper/2605.17471"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The potential of second-order optimization for llms: A study with full gauss-newton","venue":null,"work_id":"a403407c-825e-4cb9-bd16-f946d843f703","year":2026},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:482ecf02860528fb75f177da1d057c8d5d49d7468d27378c1a09b3b1914f3f7a","observation_id":"d3737db0-9ab2-4d0b-a800-d78a18c765fb","resolution":{"observed_at":"2026-05-20T14:53:31.712095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L., Li, B., Cameron, P., Jaggi, M., Alistarh, D., Hoefler, T., and Hensman, J","venue":null,"work_id":"6dc99e4a-e37d-4a20-86ec-56a611278bd9","year":2024},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a884e95afe88c44d99a26a58581000fad9e63a9535c04fe120852e586464636a","observation_id":"93ec69c9-ff8c-40ce-bb3f-5088c1f10601","resolution":{"observed_at":"2026-05-20T14:53:31.717968Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proxquant: Quantized neural networks via proximal operators","venue":null,"work_id":"496c3ba8-0987-4afc-b2bf-09ecf594e3e2","year":2019},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:dc0f40edd7812fe1f4198eba9fd75f7b597b99f49d1d48bcdd08b93e88479ee6","observation_id":"2bcbb0b3-15a2-4eb5-8d59-fb8df4dcd2b8","resolution":{"observed_at":"2026-05-20T14:53:31.705709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Some large-scale matrix computation problems","venue":null,"work_id":"14293de1-f58c-4ca6-93d4-44a1196fa814","year":1996},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:bc79772de5cc23c2bb172002dc7ee6a16adef2390242830f51e1700819c34f49","observation_id":"db0552a5-9597-4924-8eb3-29b83d43b370","resolution":{"observed_at":"2026-05-20T14:53:31.716154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-08-11T05:54:56.124984Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":"1308.3432","doi":"10.48550/arxiv.1308.3432","metadata_source":"pith","pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","venue":"cs.LG","work_id":"1fe8c7c8-aff7-4b94-9096-e549d7e60789","year":2013},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:73792644506f448b611c8701f6f34ef30b8962233ee1421604fd6683dd74c399","observation_id":"f9410d21-7d57-44e7-a8d5-56439c792447","resolution":{"observed_at":"2026-05-20T14:53:31.622415Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-19T16:22:27.235199+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"738f0338-a544-474e-9afc-bdc3eb2102fe","year":2023},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:ac36bd84a9e03c1bde25cac817ed1edef40ad3fb1bedd374110797ba947e1c53","observation_id":"e529556b-460f-4ffb-a5f5-455ee9f62d87","resolution":{"observed_at":"2026-05-20T14:53:31.716612Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Analysis of stochastic lanczos quadrature for spectrum approximation","venue":null,"work_id":"861b34ff-2b6f-4b08-ab91-2c6846d1343d","year":2021},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:443dd1763347bd7927f40d9ea46e2d236f6bf23a9b044aeb07c6bd5dddd3a599","observation_id":"4bd8853e-f3d2-44ce-b776-073edded6b19","resolution":{"observed_at":"2026-05-20T14:53:31.712839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Fast hadamard transform in cuda, with a pytorch interface","venue":null,"work_id":"639b5a19-d8dc-4595-87b6-c855006a5304","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:3032b24ebfbc9e8d2242d823ceeeb899e8b7c710d9c004863f6675c6ad798a76","observation_id":"23723677-baa0-4f82-9b79-034cbaa264e2","resolution":{"observed_at":"2026-05-20T14:53:31.714268Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.21913","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gq-vae: A gated quantized vae for learning variable length tokens","venue":null,"work_id":"039ebe15-269d-4395-9c8c-441c6f3e2daa","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:0d7025523a1a49ff639bb7fd25dde4a30c90cdbd57b8e1228a2b4dc962223ee2","observation_id":"26be97c6-4312-439c-922f-f04011e5331d","resolution":{"observed_at":"2026-05-20T14:53:31.637428Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., and Keutzer, K","venue":null,"work_id":"0ce47968-b122-4b0e-9f17-1c7b10e0b7e0","year":2019},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:952d611d21b4bb2867dd1de34de730da39c7f72636fb24f32497d18341643a99","observation_id":"da13262c-f8aa-40cf-a570-59b4b24af29a","resolution":{"observed_at":"2026-05-20T14:53:31.677044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., and Keutzer, K","venue":null,"work_id":"bb6e0b09-d4cc-42df-878e-f2510d9a5c8b","year":2020},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:d2c8561b16d629b57d6f3c3ee7e345f199251eadde41c5810fa8002735b285e8","observation_id":"9a9592b1-e487-487a-95bd-2deba3b2af6f","resolution":{"observed_at":"2026-05-20T14:53:31.694324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"K., McKinstry, J","venue":null,"work_id":"bfe38289-0916-43e1-a2e0-d1eb695abeba","year":2020},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a1d20b9372fba455c54aeb5b6444013a2c20cd61a51d6b9370343e2f367a9d63","observation_id":"2f1a770a-a99c-4956-92c6-40745fa2248e","resolution":{"observed_at":"2026-05-20T14:53:31.698385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Training with quantization noise for extreme model compression","venue":null,"work_id":"aaf95536-e55b-4726-94ee-394fb25e5884","year":2021},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a9fb4cb50f4d7c3d6ca3bf809468b36848bd8c3ccbc72c4b37fdb8583dee3779","observation_id":"98c80ae9-ac0d-4f31-84f7-8767a9b8f03e","resolution":{"observed_at":"2026-05-20T14:53:31.684709Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"G., Duan, D., Iyengar, A., Liu, J","venue":null,"work_id":"5c89c1c5-099d-442f-958c-7cfec5cd29cc","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:7043ccda0033818a2bb93753add390c4ad51b4cefc556899bb2884bfbf66d850","observation_id":"6b3d8056-8292-4a16-a977-e3586964cdec","resolution":{"observed_at":"2026-05-20T14:53:31.681827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Alistarh, D","venue":null,"work_id":"d274394e-95ec-4d80-a5ac-1d13f1a35d18","year":2022},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a4ca1442c9d2e3b164b77fd8148631b7298a85d8608037612352da84280c16dc","observation_id":"fd92ed3e-5cab-4969-9406-fe7252cdafd1","resolution":{"observed_at":"2026-05-20T14:53:31.678018Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers","venue":null,"work_id":"3bd91444-f07c-488e-9402-d6796dc89a6e","year":2023},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:7b55389ae2d5bb9a44ec723da36650a4c94b3b197d8d08a7f08e7468e73be0ba","observation_id":"f6a74c3c-9772-4459-8dea-e26fffb5c515","resolution":{"observed_at":"2026-05-20T14:53:31.690723Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"W., and Keutzer, K","venue":null,"work_id":"0c01fbad-ccb2-48e0-98fa-ade7cb7c4429","year":2022},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:afd3c72c05ba3123a128da8a99a776f1849f76b566c4c3edf443dbf2ccfe2a2d","observation_id":"20a99394-9bd0-4199-8b24-4188705af4e5","resolution":{"observed_at":"2026-05-20T14:53:31.702365Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An investigation into neural net optimization via hessian eigenvalue density","venue":null,"work_id":"636c14e6-8e44-440c-b970-f23d3e5cd0b8","year":2019},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a79ea7f00e60d02049bdfa1556d7b07eb12bfed96a2bff7f26884904b2cfa7c8","observation_id":"42bc2a11-ebde-4ff1-bda4-4443b62cd60b","resolution":{"observed_at":"2026-05-20T14:53:31.700496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference","venue":null,"work_id":"7080dd98-b805-4408-bfe6-4580f14bd605","year":2018},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:3582e58769035f67e3ab1d5c7bc96e78d175cb834e0bffb9d26307a4b89afbe7","observation_id":"81a5202f-292f-4bb6-a800-79f136f806dd","resolution":{"observed_at":"2026-05-20T14:53:31.683608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"M., and Jordan, M","venue":null,"work_id":"803a50cc-996f-4e76-9a93-81ae3b2c03c3","year":2017},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:68b9d0878f83623383e10d313cd04180ab6254dc84dc8269856f345caa2d7648","observation_id":"c211b17f-fb15-465f-950b-bb9bc7e9ca19","resolution":{"observed_at":"2026-05-20T14:53:31.688965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6a59d368-55a5-4d95-bd05-899645a04f58","year":2022},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:e076a66170a44828bff4ca21e2d3ce63b1bc089f235311265d55268bf499a5bb","observation_id":"47458962-63a1-483f-bd88-35e710f8da6d","resolution":{"observed_at":"2026-05-20T14:53:31.676237Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e187557-84b0-4592-9822-ac223c578ac0","year":2023},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:da91bb9ff87ffd68de42dac79302bfc22cfa726744874e38aa6d79ac2dc990b6","observation_id":"adbba272-da8f-4cfe-96cf-d419a15b895a","resolution":{"observed_at":"2026-05-20T14:53:31.696164Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"F., Bordelon, B., Muennighoff, N., Paul, M., Pehlevan, C., Re, C., and Raghunathan, A","venue":null,"work_id":"cd7e352e-c748-448a-80a2-8b9ebc575cef","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:d1dbc5f4e7c3a45ad87fcc9d9c37f2c7532fe0a9e093343a2920ee25c1d967fc","observation_id":"a7e92d09-50ce-4625-aef8-c2c504198620","resolution":{"observed_at":"2026-05-20T14:53:31.649480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.08757","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"H., Gil, S., Anand, N., and Kakade, S","venue":null,"work_id":"7dfb7480-4578-4ca2-a1c5-7d3a6aa69cbf","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:d01fdaa04ab55343c8b7c7087f743d154eef9ca184467a427d9517f73f126610","observation_id":"aafcbcbf-f7e7-43d7-8e91-5a912031b0c4","resolution":{"observed_at":"2026-05-20T14:53:31.640359Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Awq: Activation-aware weight quantization for on-device llm compression and acceleration","venue":null,"work_id":"37dd2511-fa8f-469b-ab89-d7d4891c33e4","year":2024},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:f3533c64357b74af6ff8a04da91063a8ea2abb867eba046a44f66e2934765871","observation_id":"997d89e7-2822-4192-a40a-1074f38dcd33","resolution":{"observed_at":"2026-05-20T14:53:31.680014Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bit: Robustly binarized multi-distilled transformer","venue":null,"work_id":"1a194633-796f-49c0-b176-6e56d642a29a","year":2022},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:fc4e66f74bc9ab8e8c041022d3fce84b289df822fefe5d1b3c9b8a02e36654bd","observation_id":"fee49741-bffb-4acb-aa68-44957e9f1f9d","resolution":{"observed_at":"2026-05-20T14:53:31.682883Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Spinquant: Llm quantization with learned rotations","venue":null,"work_id":"dce483a1-1266-4f4d-8076-4fcaeaa3c8a8","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:03a68ab5920c0db9812de7c3058fa8a3fc69b47f84597b91f0c369a181ce2a81","observation_id":"2464149b-950e-4173-8520-67d86a60c536","resolution":{"observed_at":"2026-05-20T14:53:31.692322Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paretoq: Scaling laws in extremely low-bit llm quantization","venue":null,"work_id":"bfaaf96f-f436-418f-b804-c68069440b49","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:45d5ac9de15cae9cb59fb277c0feb259d692563eee113a6d372072ee96e644ce","observation_id":"f2838259-fded-4492-87c7-d965dff96121","resolution":{"observed_at":"2026-05-20T14:53:31.686490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A., Datta, P., Dean, J., Jain, P., and Kusupati, A","venue":null,"work_id":"e0ec29f3-9822-4415-ae1c-2a445963e5e8","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:8ffa0d2be2d665151899fa6f4b5d045755a617c56558622300497d8b22e4ae4d","observation_id":"d22af3dc-2c0b-4c55-aae6-08ed2b3d32ec","resolution":{"observed_at":"2026-05-20T14:53:31.703805Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lectures on convex optimization, volume 137","venue":null,"work_id":"9735717e-a86d-47c6-b8db-76d12185a954","year":2018},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:13f58848d8ea69ebb849aa28991cefe566526dd6a57d7d600de4191046258caf","observation_id":"eb481fb0-a97d-4fb1-84be-50d78f135a71","resolution":{"observed_at":"2026-05-20T14:53:31.679021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"L., Nikdan, M., and Alistarh, D","venue":null,"work_id":"73dbc70d-8507-47bf-9ff0-ce2c4f5ab9b0","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:6a3ff56feeb1be6e339f54cb52b0a175de87dbe9a059bc673d06ed227e2da0dc","observation_id":"b7e065f4-8a12-4866-acb2-927f8c8f00df","resolution":{"observed_at":"2026-05-20T14:53:31.687211Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2510.18784","last_updated":"2026-06-18T13:37:57Z","snapshot_observed_at":"2026-08-09T19:05:45.771678Z","submitted_at":"2025-10-21T16:33:57Z","title":"CAGE: Curvature-Aware Gradient Estimation For Accurate Quantization-Aware Training","version":3},"cited_work":{"arxiv_id":"2510.18784","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2510.18784","snapshot_observed_at":"2026-06-19T17:11:53.086525Z","title":"Cage: Curvature-aware gradient estimation for accurate quantization-aware training","venue":null,"work_id":"6d5f50b2-b39e-4c96-8a83-e95c3a2e8f96","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"cited_paper":"/paper/2510.18784","citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:e19ccca072e10e4b34ec5b8b38b7f4d159d21d30e73e53b71cad11c5e14904bc","observation_id":"e096898f-08db-494a-badf-593a2e10c5ee","resolution":{"observed_at":"2026-06-19T17:11:53.086525Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11453","last_updated":"2023-10-17T17:59:15Z","snapshot_observed_at":"2026-08-11T03:44:43.109946Z","submitted_at":"2023-10-17T17:59:15Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","version":1},"cited_work":{"arxiv_id":"2310.11453","doi":"10.48550/arxiv.2310.11453","metadata_source":"pith","pith_arxiv_id":"2310.11453","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"BitNet: Scaling 1-bit Transformers for Large Language Models","venue":"cs.CL","work_id":"28ad8f61-4291-4894-b120-1d42fc9937a3","year":2023},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"cited_paper":"/paper/2310.11453","citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:7070b9c22b194041be88c3a7f410eea9736bb396bebf7bbd4e3a2192731ec139","observation_id":"b850bf47-6eed-4ef3-ae19-5290f27c210c","resolution":{"observed_at":"2026-05-20T14:53:31.637256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"638c4a5a-09d3-470c-9878-df5757e18d9b","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:6341da82b9e7e7f8700242053f3a1fd0bbc3cbecb4c9c7cea1c7b007e7e76d3c","observation_id":"4fc41ef6-372e-48f3-b42e-67d7b1950451","resolution":{"observed_at":"2026-05-20T14:53:31.669174Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c4a6c6a-2b61-4070-8929-7be1b4d85a4d","year":2018},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:2f375c227076dc59127289fb29a37d3529fb6976d38f14287a79a883c0f74dd2","observation_id":"d79b8b15-40f4-4a84-86a0-f60e04b35d34","resolution":{"observed_at":"2026-05-20T14:53:31.698090Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"082e09ef-b6e3-4009-970e-83068885a791","year":2020},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:fd16f98e9b72e4126319647e624e6bb206effcd01e4791bb5fe8bfa666f297cd","observation_id":"f69b5a88-58e5-40d6-acb5-e8ac03b48245","resolution":{"observed_at":"2026-05-20T14:53:31.674991Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Modulora: finetuning 2-bit llms on consumer gpus by integrating with modular quantizers","venue":null,"work_id":"f154fbfe-832a-4e49-a9d6-2db8375fcd7e","year":2024},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:86d0b6a48cf50611cbdef888244477182f0f80e970712adb7c546319ff1f227c","observation_id":"b0baf9b0-14ef-410e-b5fa-9050845afb61","resolution":{"observed_at":"2026-05-20T14:53:31.661389Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large batch optimization for deep learning: Training bert in 76 minutes","venue":null,"work_id":"44faff5b-17cf-4101-919a-7125d77781f7","year":2020},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a42745cac96931f19d92c971dfc1305e486c8db8948d765bb99b7b0fe5aa1f7c","observation_id":"4e903211-2259-46df-a47f-def832eee661","resolution":{"observed_at":"2026-05-20T14:53:31.701966Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"R., Li, D., and Ju, H","venue":null,"work_id":"92bd5391-7620-4cac-8520-6996daee6cae","year":2024},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:68983fa37f63a211cdf019dabd0a9babd596496bcac16cc5923fea52e4c4584c","observation_id":"beaa2435-6e3d-456d-9a1e-2b745bbbbab3","resolution":{"observed_at":"2026-05-20T14:53:31.699748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Q-hitter: A better token oracle for efficient llm inference via sparse-quantized kv cache","venue":null,"work_id":"908261d4-cc08-43f6-abd3-990b3c7b4e7d","year":2024},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:672633e0e527f477b4ff400ee4f34435d89a052aeb01bbcf8f0cd652718cbabb","observation_id":"ed98a403-b67e-4295-baa3-6aed1fb24758","resolution":{"observed_at":"2026-05-20T14:53:31.696682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"54c1e956-e27e-473e-bc60-03785d23de59","year":2025},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:a0f6617c4ce1478c302564c0e729f8b6fa3067b6944242780fdc4b06586de8ee","observation_id":"b036e678-6d5b-49e9-9488-d0ebfa61e54b","resolution":{"observed_at":"2026-05-20T14:53:31.694141Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"3a047d28-65fc-4910-bb99-65ec6673264e","year":2026},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:5ca1f770cd6713f80a5f4793b7b4dd518b47b97b182ae5e34a3c3f170f8f90ce","observation_id":"7a2edca3-e151-408f-824c-d184a3618838","resolution":{"observed_at":"2026-05-20T14:53:31.674276Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e8fac253-e4f7-4900-80f0-332241ee41b4","year":2026},"citing_paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-20T14:53:22.233844Z"},"links":{"citing_paper":"/paper/2605.17471"},"observation_digest":"sha256:c1253495d1c32fc47139172b3719246fde35c55da53141304b12ddc6124b1d66","observation_id":"54c375af-e964-417b-8fd1-9e9d8651aedb","resolution":{"observed_at":"2026-05-20T14:53:31.685416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.17471","last_updated":"2026-05-17T14:20:51Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T23:28:26.397778Z","submitted_at":"2026-05-17T14:20:51Z","title":"WinQ: Accelerating Quantization-Aware Training of Language Models Around Saddle Points"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":5,"verified_fuzzy":29},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2605.17471."}