{"as_of":"2026-08-08T09:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0e5f16548545c3900872de3b4f75d7aefc6229fac492c62793b4deee9f16b596","coverage":[{"denominator":52,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":52,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T00:40:42.454078Z","state":"measured"},{"denominator":52,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":52,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.01034/citation-record","integrity":"/paper/2608.01034/integrity","json":"/paper/2608.01034/citation-record.json","paper":"/paper/2608.01034"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-06T00:40:38.019213Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.019213Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:584bcfe37c139bb0d671d7c4018baf236bc56c0d1db0536a57cde7b45edd1653","observation_id":"26254f2f-6208-40fb-a20f-af95781bd4ee","resolution":{"observed_at":"2026-08-06T00:40:38.019213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.085286Z","title":"Paech, Paul Pak, Rom N","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.085286Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9ff5506ee430cb6dd89ee69acb701fd466855d213e46bc0635ac069386fe9d5f","observation_id":"2f4195d7-0ee4-4257-8e6a-189714d90795","resolution":{"observed_at":"2026-08-06T00:40:38.085286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:46.226404Z","title":null,"venue":null,"work_id":"8016493c-ed53-4a9a-9df0-e2b7f3490ca4","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.127831Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:1b8c030f544117abfe4b90bc8f179abfb255fa9586f9be0361b6a043885f855b","observation_id":"db4c5e0c-4960-416a-bdf6-e46d7d64c679","resolution":{"observed_at":"2026-08-06T00:40:46.326365Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:46.009371Z","title":"Core ml tools.https://github.com/apple/coremltools","venue":null,"work_id":"c7da089f-6b72-431d-9828-7c42dd742cb9","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.186985Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:378810e601ad74b102f83e8b105e4f580f95b840751e0e7d17de41797aa49253","observation_id":"49eda807-5519-48ec-b724-b436b30dad8b","resolution":{"observed_at":"2026-08-06T00:40:46.128012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.269476Z","title":"Exaone 4.0: Unified large language models integrating non-reasoning and reasoning modes, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.269476Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:2f8dc5e68fd4433b15c017bfae057c35f8e8360375bbb6b70ce5c68b658ea52a","observation_id":"d932d690-ee40-467c-aa46-1414676f33bb","resolution":{"observed_at":"2026-08-06T00:40:38.269476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.333365Z","title":"PIQA: reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.333365Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:45382b1df15edc333cc5c3c7ad576eedb387e6f3d5fe207d54f93994baaab79c","observation_id":"5ead73c5-7807-49a4-bcdb-d578962e5ea4","resolution":{"observed_at":"2026-08-06T00:40:38.333365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.412592Z","title":"Generating long sequences with sparse transformers,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.412592Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:b9d28281ebeda3048a660acbbac95da2ba78c40e4dcea93ea775afddc75ffcbe","observation_id":"f8727d1d-dc1d-470a-b2bc-7fd2a455bc4f","resolution":{"observed_at":"2026-08-06T00:40:38.412592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-06T00:40:38.533077Z","title":"Think you have solved question answering? try arc, the AI2 reasoning challenge.CoRR, abs/1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.533077Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9bc5cf6e1169a4bb5a8978ccfe8dfb9448c970d62742f5cb13f698cdc8521b15","observation_id":"2bed0ca4-d95c-48d8-8461-6e7bd958fee2","resolution":{"observed_at":"2026-08-06T00:40:38.533077Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-06T00:40:38.593589Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.593589Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:00d08b34159340e728d5cc59062430d375764de94c1a59f0176d566d9e95824e","observation_id":"a61c791f-5969-4960-b805-85b045b497fd","resolution":{"observed_at":"2026-08-06T00:40:38.593589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.05442","last_updated":"2023-02-10T18:58:21Z","snapshot_observed_at":"2026-08-04T12:07:24.626442Z","submitted_at":"2023-02-10T18:58:21Z","title":"Scaling Vision Transformers to 22 Billion Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.05442","snapshot_observed_at":"2026-08-06T00:40:38.653520Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.653520Z"},"links":{"cited_paper":"/paper/2302.05442","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:f6cc42415834e60d5cb99907690352bad9e5ea1bb398140db17f91d455c24444","observation_id":"a09046c1-03fd-451d-91a8-f87589e196ff","resolution":{"observed_at":"2026-08-06T00:40:38.653520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.08153","last_updated":"2020-05-07T03:30:49Z","snapshot_observed_at":"2026-08-07T23:40:04.424513Z","submitted_at":"2019-02-21T17:31:32Z","title":"Learned Step Size Quantization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.08153","snapshot_observed_at":"2026-08-06T00:40:38.734813Z","title":"Esser, Jeffrey L","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.734813Z"},"links":{"cited_paper":"/paper/1902.08153","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:fa9127a2c343fe4ea06f9477e61fe42e85c12e54124bc3ac58eb701ff34bb87b","observation_id":"a211fb2b-3085-45b4-8bf1-583eef5a886f","resolution":{"observed_at":"2026-08-06T00:40:38.734813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-08-07T08:38:54.025062Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.17323","snapshot_observed_at":"2026-08-06T00:40:38.814115Z","title":"Gptq: Accurate post-training quantization for generative pre-trained transformers, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.814115Z"},"links":{"cited_paper":"/paper/2210.17323","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:e137ef676867d0ffc219de05f3c1160e7b62ecca0132cefde7609722a2ca7bea","observation_id":"129b9143-8edd-44b0-9ab5-1b7282e9ab6c","resolution":{"observed_at":"2026-08-06T00:40:38.814115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.871473Z","title":"The language model evaluation harness, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.871473Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:25d85698d3195d87aae2a6de796a81e7fcec6dadd88b640e1638a5f6be895c2e","observation_id":"f4e51269-2a07-46dd-8bab-2a1e0167b965","resolution":{"observed_at":"2026-08-06T00:40:38.871473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:38.933822Z","title":"How to train long-context language models (effectively), 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.933822Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9cd6f11345d3dfc0b6e4e941860570d7c3585069e91164d7f46dfd864a5b7471","observation_id":"7eb2464a-6bf5-47b2-afee-1fa374100af3","resolution":{"observed_at":"2026-08-06T00:40:38.933822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.760429Z","title":"llama.cpp.https://github.com/ggml-org/llama.cpp, 2023","venue":null,"work_id":"dc9218d9-3fda-4226-b481-1b58698c2969","year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.994194Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:5a7556873f044d4b4a1dd27af3c58b8c1e212437354e8fd184716247e87a47a3","observation_id":"e693ea16-a732-4743-b279-04c151e82643","resolution":{"observed_at":"2026-08-06T00:40:45.865875Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T00:40:39.040476Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.040476Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:6529c38a2e16b71b63cf263cbaca83f33bf913b85fbc8b9cfb36392009b21ad8","observation_id":"1d5c526f-1a3f-480d-be16-aadcdf8079e1","resolution":{"observed_at":"2026-08-06T00:40:39.040476Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T00:40:39.090330Z","title":"Measuring massive multitask language understanding.arXivpreprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.090330Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:4865ca76885362d8605e974d6427b14abd43d9ed260da9fd0b11b8a0674d3422","observation_id":"61e50499-6a48-40b6-9bca-536dacbd0b57","resolution":{"observed_at":"2026-08-06T00:40:39.090330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-06T00:40:39.170029Z","title":"Distilling the knowledge in a neural network, 2015","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.170029Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:0d8cbc8085c9e7706790eb2ead2d811af18b03c85624e90e4e5646c6310f79bd","observation_id":"e29d8689-ee60-4871-a7df-4f6d9cbe0f64","resolution":{"observed_at":"2026-08-06T00:40:39.170029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.495465Z","title":"nanotron.https://github.com/huggingface/nanotron, 2024","venue":null,"work_id":"41cefb70-a5ff-4cce-960f-96151f6ca66f","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.223713Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:cf64c255b3b84d423992b51b974d91f46e12c30a1fe78dd69766734196752235","observation_id":"8baf06ec-6f06-4843-a1ec-a116e16e44c4","resolution":{"observed_at":"2026-08-06T00:40:45.599027Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.267828Z","title":"Quantization and training of neural networks for efficient integer-arithmetic-only inference,","venue":null,"work_id":"a0e8cb77-b4ba-435f-8fb8-19947a74ea0a","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.315215Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:7c93a1663595232c11a5a3f4f825cebde03938acf595b411a6f8470e402f3455","observation_id":"61c835e7-493a-4a0c-ade6-381417594b78","resolution":{"observed_at":"2026-08-06T00:40:45.358714Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04541","last_updated":"2022-04-09T20:13:51Z","snapshot_observed_at":"2026-07-06T12:58:35.177001Z","submitted_at":"2022-04-09T20:13:51Z","title":"KOBEST: Korean Balanced Evaluation of Significant Tasks","version":1},"cited_work":{"arxiv_id":"2204.04541","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04541","snapshot_observed_at":"2026-08-06T00:40:43.052000Z","title":"KOBEST: Korean Balanced Evaluation of Significant Tasks","venue":"cs.CL","work_id":"1bdbd3e4-d26f-4441-8802-0cc5e2cbf854","year":2022},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.472885Z"},"links":{"cited_paper":"/paper/2204.04541","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:aa0327ec39428e5df50af7593424fe6af85096c1ba1231327b5d46dded4b4a91","observation_id":"1567ab7a-6066-40fa-88d8-ec1db6f1d13e","resolution":{"observed_at":"2026-08-06T00:40:43.165120Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.06412","last_updated":"2024-07-04T13:08:19Z","snapshot_observed_at":"2026-08-04T04:40:39.327049Z","submitted_at":"2024-03-11T03:54:33Z","title":"CLIcK: A Benchmark Dataset of Cultural and Linguistic Intelligence in Korean","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.06412","snapshot_observed_at":"2026-08-06T00:40:39.536784Z","title":"Click: A benchmark dataset of cultural and linguistic intelligence in korean, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.536784Z"},"links":{"cited_paper":"/paper/2403.06412","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:0ce00c5422d05123ee4762d59774f8afceb553114b04fefc09289d429dce5896","observation_id":"12760d5d-05da-4aa5-b0f3-5656c2a52b22","resolution":{"observed_at":"2026-08-06T00:40:39.536784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.09426","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:42.803517Z","title":"Kormo: Korean open reasoning model for everyone, 2025","venue":null,"work_id":"2207dee3-6536-4c6c-b82c-b716eee074a2","year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.566528Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:41913c41098ffcbf2a43c908427e40652859ac915b0db83c524b98194dd90fbb","observation_id":"2ae952a5-60a9-4096-a321-d261c3191a48","resolution":{"observed_at":"2026-08-06T00:40:42.895111Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T00:40:39.569435Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.569435Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:2720d8000b0ba229ae2ad8b5d6a3a91762e181ce507dfb3d4d19aea1eceee79c","observation_id":"495fe7a6-70ef-4dee-8735-841557feabad","resolution":{"observed_at":"2026-08-06T00:40:39.569435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:45.097690Z","title":"Awq: Activation-aware weight quantization for llm compression and acceleration,","venue":null,"work_id":"19793305-d30a-475a-9877-c0c832912ecd","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.613669Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:0839c1c5fc4c717244baff0d5d18e4bad6d691db3ee125d3401d5be761e67ca6","observation_id":"86c9e491-ef4a-4fab-b37f-7eafb40bfd39","resolution":{"observed_at":"2026-08-06T00:40:45.194412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-06T00:40:39.734993Z","title":"Decoupled weight decay regularization.arXiv preprintarXiv:1711.05101, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.734993Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:5eb0b90288d1fb6d5671451447f2a86aeb9281e9d76623e61dcd014dbc74f049","observation_id":"34715b5d-ba39-4436-b4ec-e25a392bf696","resolution":{"observed_at":"2026-08-06T00:40:39.734993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.875470Z","title":"NVIDIAH200tensorcoreGPU,2024","venue":null,"work_id":"79c747eb-4123-41b8-89f7-83f6a41c5029","year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.819877Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:796d49032761c910af158c7a68202cc0743669f6d2fba57cb08b50514874c4fe","observation_id":"9f2d2f49-4d09-4560-913a-ab135588f2b1","resolution":{"observed_at":"2026-08-06T00:40:44.980104Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.548747Z","title":"Nemotron-h: A family of accurate and efficient hybrid mamba-transformer models,","venue":null,"work_id":"6bdddd7f-5abd-4df1-b644-7bbc6c804ac8","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.933198Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:ed1fdd450a6c94244dee6bb98f28b5490c50710edd4ceae39209afbb67c2c49a","observation_id":"5c85173f-959b-4ccc-a867-c8bc83030d6c","resolution":{"observed_at":"2026-08-06T00:40:44.716747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.319450Z","title":"Qualcomm ai engine direct","venue":null,"work_id":"d71b5457-eba1-428a-80df-26194c69d4f1","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.118096Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:9045ae38938014a4eba53c2e490e26363c7ec81f7fa91f3484004c00046069cf","observation_id":"1386fefd-747f-42c1-9bf9-59b583fa4382","resolution":{"observed_at":"2026-08-06T00:40:44.423595Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-06T00:40:40.190491Z","title":"GPQA: A graduate-level google-proof q&a benchmark.arXivpreprintarXiv:2311.12022, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.190491Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:aa038618eaa64f314c106c44f2c6fa9f6ec59567310351e0c439b7bb3ce4d704","observation_id":"5f706c30-b203-4736-85c8-4164f6cb7872","resolution":{"observed_at":"2026-08-06T00:40:40.190491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-06T00:40:40.245964Z","title":"Winogrande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.245964Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:cdf2e758478969912e8b85dc555464a057a8f0de968aeb3291e9df4382cd5a69","observation_id":"b1c2bde4-749b-4fae-8574-9659f9edce52","resolution":{"observed_at":"2026-08-06T00:40:40.245964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:44.157789Z","title":"Neural machine translation of rare words with subword units,","venue":null,"work_id":"3aa9114d-ed5f-4dd1-9230-3e4875dc4079","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.389754Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:a24cc3c061f19633c863122c1f8b5db5688b12ad955331093445f36f988b8798","observation_id":"9603918e-329c-487f-a07c-b96d1d0e9aa2","resolution":{"observed_at":"2026-08-06T00:40:44.202901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-06T00:40:40.599281Z","title":"Glu variants improve transformer, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.599281Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:a87ebce0b8a5ebd7ed01485329431e0ed18549d3ffc97e068cb726c5bb463a30","observation_id":"d4c912bb-1b28-4f33-bbc6-9feccd4befd3","resolution":{"observed_at":"2026-08-06T00:40:40.599281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:43.949441Z","title":"Kmmlu: Measuring massive multitask language understanding in korean,","venue":null,"work_id":"cb4d78f8-9982-44ea-b7eb-06dbe12bf83f","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.768124Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:91f5a74df423e2fa6db96e0ddc93b3ee9289bee6c9ee2282d29864ab89b7163d","observation_id":"9756f803-6b06-46fc-81c6-97b62929fa36","resolution":{"observed_at":"2026-08-06T00:40:44.090483Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.02706","last_updated":"2024-03-20T16:56:48Z","snapshot_observed_at":"2026-07-06T16:15:00.517258Z","submitted_at":"2023-09-06T04:38:16Z","title":"HAE-RAE Bench: Evaluation of Korean Knowledge in Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.02706","snapshot_observed_at":"2026-08-06T00:40:41.046534Z","title":"Hae-rae bench: Evaluation of korean knowledge in language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.046534Z"},"links":{"cited_paper":"/paper/2309.02706","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:75f9b522b22c150d0711dd18e81ec3a5f119e29fd865930054398f2141755ad1","observation_id":"f4ce0ec8-1431-40e9-8312-6fd4ff5b33e0","resolution":{"observed_at":"2026-08-06T00:40:41.046534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:43.678247Z","title":"Stm neural network deployment framework.https://stm32ai.st.com/stm32-cube-ai/","venue":null,"work_id":"03db07ed-9137-4a29-be66-9d8f67beb436","year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.149824Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:bcf0c775e5d96edab0a4e6b9339553a1efa66feab4714660daae7cca8dd0bfa6","observation_id":"36e3fe84-11fc-4c0f-934e-08e856b343d8","resolution":{"observed_at":"2026-08-06T00:40:43.825657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-06T00:40:41.270369Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.270369Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:1174082478b8f17e2db7c72bf14e2893fa5949884f80e85309b0339bb3d82e2e","observation_id":"a1b1f3c2-124b-4e57-b821-d5c4e3e33ed7","resolution":{"observed_at":"2026-08-06T00:40:41.270369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T00:40:41.373707Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.373707Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:4aa05ef48469b0526c83e04a745c440d47cb6957ad6fbdb21461070ba4705efd","observation_id":"648a2b45-44fa-4ffd-b692-b708e2fcf041","resolution":{"observed_at":"2026-08-06T00:40:41.373707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.26692","snapshot_observed_at":"2026-08-06T00:40:41.501338Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.501338Z"},"links":{"cited_paper":"/paper/2510.26692","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:242bf0226e0bf82d94cb2bc789e69c5f9edb3089e8426dd814e7987ffd3af8cb","observation_id":"d9e68187-39e5-4773-9534-c587381be35c","resolution":{"observed_at":"2026-08-06T00:40:41.501338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-06T00:40:41.641972Z","title":"An empirical study of mamba-based language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.641972Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:412ba61205d547e5c0d0f0a28170eba23c524ea56ce9bf141d6659dc357c977e","observation_id":"cd9c3415-c91d-4683-9c51-2e8a379a6f25","resolution":{"observed_at":"2026-08-06T00:40:41.641972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T00:40:41.747432Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.CoRR, abs/2406.01574,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.747432Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:54dbeb830b6cd65aee781b86913664a4ab53c654abc522313e590b4b7712c02e","observation_id":"138c3787-3c23-4729-90aa-28fde24182bd","resolution":{"observed_at":"2026-08-06T00:40:41.747432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-06T00:40:42.089130Z","title":"Huggingface’s transformers: State-of-the-art natural language processing, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.089130Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:13b29e0363aff9ebe5da0a1a2ad661e48090e2100f920a6fd22e4fa314fb3450","observation_id":"f66a204f-be3f-4973-bdda-e35a0c85edd1","resolution":{"observed_at":"2026-08-06T00:40:42.089130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T00:40:42.201123Z","title":"Qwen3 technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.201123Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:dcafadb3865fd703449fb1fb0894c8b4319e267c6a16da777bcebb3a2ec97d0d","observation_id":"a9b2fff2-02c7-4949-a467-b000fc3062e1","resolution":{"observed_at":"2026-08-06T00:40:42.201123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.06464","last_updated":"2025-03-06T06:57:34Z","snapshot_observed_at":"2026-08-03T00:27:18.402796Z","submitted_at":"2024-12-09T13:09:04Z","title":"Gated Delta Networks: Improving Mamba2 with Delta Rule","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.06464","snapshot_observed_at":"2026-08-06T00:40:42.308311Z","title":"Gated delta networks: Improving mamba2 with delta rule, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.308311Z"},"links":{"cited_paper":"/paper/2412.06464","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:6188051cd3f3ded0af32faccd3bf7a343c76f8036ddd95d1f83af2410f7f5299","observation_id":"1fe68431-eed4-4653-a4eb-de2f2def4143","resolution":{"observed_at":"2026-08-06T00:40:42.308311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T00:40:42.454078Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:42.454078Z"},"links":{"citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:1ce52a8656d3d6ee5400f5d84c0ac07cf8ec6ece6a624a735700f95b20f2bca5","observation_id":"9f30c5f3-1fb6-4472-8126-e7ce292b71fe","resolution":{"observed_at":"2026-08-06T00:40:42.454078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-06T00:40:41.883305Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:41.883305Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:ce4e09c441d4c893836f8d096fb2be42b1cb4d1a6ed2d340e35d85904e14f2c2","observation_id":"42c24c00-48e1-4682-bad4-2674cfa00e19","resolution":{"observed_at":"2026-08-06T00:40:41.883305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-07-06T04:28:16.222296Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-06T00:40:40.497194Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.497194Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:b22788bd5759efeaef391eddfc6913b1f79dee48df26cb0e32a861831ad7d50a","observation_id":"13fc859e-fde7-47dd-81a0-4a48dada7752","resolution":{"observed_at":"2026-08-06T00:40:40.497194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.05877","last_updated":"2017-12-15T23:56:52Z","snapshot_observed_at":"2026-07-06T06:14:38.280461Z","submitted_at":"2017-12-15T23:56:52Z","title":"Quantization and Training of Neural Networks for Efficient Integer-Arithmetic-Only Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.05877","snapshot_observed_at":"2026-08-06T00:40:39.362349Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.362349Z"},"links":{"cited_paper":"/paper/1712.05877","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:214d23a564bbd449e0597850a7f114408e944d17b264d37d8326b9b063fc48fd","observation_id":"54ba9700-648a-42ac-88ad-dce3c3af0f3c","resolution":{"observed_at":"2026-08-06T00:40:39.362349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-06T08:05:35.311510Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-06T00:40:38.452513Z","title":null,"venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:38.452513Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:c57c67195dce4aef81c7d4fde3082e442983967abd648fb0f5293f229f6f6f3e","observation_id":"10e8a21b-340b-46c6-8e92-b619f0f359e6","resolution":{"observed_at":"2026-08-06T00:40:38.452513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11548","last_updated":"2024-06-06T12:23:58Z","snapshot_observed_at":"2026-08-06T05:59:58.625725Z","submitted_at":"2024-02-18T11:41:07Z","title":"KMMLU: Measuring Massive Multitask Language Understanding in Korean","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11548","snapshot_observed_at":"2026-08-06T00:40:40.947491Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.947491Z"},"links":{"cited_paper":"/paper/2402.11548","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:958fb55f2fe55ee3e06aadb7aed30d85486804ee4001924ec06cb33fc099fda4","observation_id":"effd9e86-44ed-4cbc-9d56-4231edeef1c1","resolution":{"observed_at":"2026-08-06T00:40:40.947491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.03624","last_updated":"2025-09-05T17:58:38Z","snapshot_observed_at":"2026-08-07T16:08:37.984756Z","submitted_at":"2025-04-04T17:41:58Z","title":"Nemotron-H: A Family of Accurate and Efficient Hybrid Mamba-Transformer Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.03624","snapshot_observed_at":"2026-08-06T00:40:40.028368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:40.028368Z"},"links":{"cited_paper":"/paper/2504.03624","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:ce3beca9fd9b9883cc3fa3c3076ff96f56ba26be98da1ec32a7e6311d633df05","observation_id":"080a09ab-e8a6-47a6-86e6-0ccf7b646661","resolution":{"observed_at":"2026-08-06T00:40:40.028368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-06T00:40:39.648672Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-06T00:40:39.648672Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2608.01034"},"observation_digest":"sha256:074b80ee3a927a7b2de5e4d336b1b89a1a5740fa86ef82b904c16d03e4e7e17a","observation_id":"3e006c11-1cc5-4c73-9543-407fb53a993a","resolution":{"observed_at":"2026-08-06T00:40:39.648672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.01034","last_updated":"2026-08-04T01:57:33Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T23:09:42.763660Z","submitted_at":"2026-08-02T06:43:25Z","title":"Opt.Gear Technical Report"},"reference_resolution":{"displayed":52,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":52},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 52 of 52 outbound references and 0 inbound Pith citation observations for arXiv:2608.01034."}