{"as_of":"2026-08-16T18:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:692b4ae74b02b624d521d7288bb7160ad8a56425e98d2b003396562838d24d1c","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T20:10:20.416886Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.00046/citation-record","integrity":"/paper/2502.00046/integrity","json":"/paper/2502.00046/citation-record.json","paper":"/paper/2502.00046"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2007.03051","last_updated":"2020-07-06T20:24:31Z","snapshot_observed_at":"2026-08-14T13:11:27.922295Z","submitted_at":"2020-07-06T20:24:31Z","title":"Carbontracker: Tracking and Predicting the Carbon Footprint of Training Deep Learning Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.03051","snapshot_observed_at":"2026-08-10T20:10:20.309203Z","title":"Wolff Anthony, Benjamin Kanding, and Raghavendra Selvan","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.309203Z"},"links":{"cited_paper":"/paper/2007.03051","citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:694486245937688abbd66e429e0589957637bf9eaf308019660b5c62aa4e8baf","observation_id":"e54d76d6-fe98-409a-9b5b-e31e68daa704","resolution":{"observed_at":"2026-08-10T20:10:20.309203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.314235Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.314235Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:3d90c6108a2aabda5fa2179d2fe70675c421ea03a2e0ebc8100066a567a30080","observation_id":"1c8d9856-4fd9-4392-a263-957bea6556cc","resolution":{"observed_at":"2026-08-10T20:10:20.314235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-10T20:10:20.318354Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.318354Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:bfc5fe2ce8a121c8a99f4d797ac64f17f20d76a59cb7d28425aea6dcb2603d3c","observation_id":"ac8ce482-26be-41c7-a921-3a6c5ca12f31","resolution":{"observed_at":"2026-08-10T20:10:20.318354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.02861","last_updated":"2022-06-20T16:05:15Z","snapshot_observed_at":"2026-08-16T17:51:24.775263Z","submitted_at":"2021-10-06T15:43:20Z","title":"8-bit Optimizers via Block-wise Quantization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.02861","snapshot_observed_at":"2026-08-10T20:10:20.323263Z","title":"8-bit optimizers via block-wise quantization","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.323263Z"},"links":{"cited_paper":"/paper/2110.02861","citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:dc2dd32d360a58150e092e78adb90557d18d9e3c958ea47b1514ba3cecccb78e","observation_id":"68d31d00-a39f-45f7-9514-84cd3ca516b4","resolution":{"observed_at":"2026-08-10T20:10:20.323263Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-13T23:56:42.354755Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-10T20:10:20.327819Z","title":"Qlora: Efficient finetuning of quantized llms","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.327819Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:2dccfbde95a1ab92636393862b8d230a902459ad0cf016957220d7eeb6dcaeb5","observation_id":"c30ab8fd-a474-44f9-a50f-89abff5dcbef","resolution":{"observed_at":"2026-08-10T20:10:20.327819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-16T15:26:27.063395Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-10T20:10:20.332494Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.332494Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:d45e8ee7f0ebc40fbfdba6d367ccdf88f77beed2b72fdb77e636d2f63603180f","observation_id":"a8809b62-cb6d-49e8-9692-2033fa0605ff","resolution":{"observed_at":"2026-08-10T20:10:20.332494Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.337309Z","title":"The case for 4-bit precision: k-bit inference scaling laws","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.337309Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:28e0d6a5a866fa074c656f67100401146a48010b583dc4d85f860ef6ebc84ca2","observation_id":"d37521cb-17f6-405f-abd9-4344399dedfb","resolution":{"observed_at":"2026-08-10T20:10:20.337309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.341080Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.341080Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:aba84aa2bcfae798dd95682927baf1c3d3948e3d6ce45de74d30805806bee19c","observation_id":"653b8c4f-d744-445b-9eeb-4a1a38f2adcf","resolution":{"observed_at":"2026-08-10T20:10:20.341080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.345301Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.345301Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:6b013986746df0fe5177ca857ed71a8fed8eb93bd7b19c70f525c44772b40e42","observation_id":"e66c84f6-9852-48d8-bc7e-2f4eaf6a1e12","resolution":{"observed_at":"2026-08-10T20:10:20.345301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.349880Z","title":"Minillm: Knowledge distillation of large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.349880Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:47034babf679048eccbedb439ee8c333c49afd2f9d08b368cbdf760e5124819f","observation_id":"b1b05359-f367-424f-9ce6-4e2dfd569099","resolution":{"observed_at":"2026-08-10T20:10:20.349880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.688361Z","title":"A simple and effective method for removal of hidden units and weights","venue":null,"work_id":"35d15be7-86aa-44aa-a895-7da9371f8b25","year":1994},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.353593Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:9cea2f3771ae6b31b4857bd2616943072139741b4adc47a35cd10a6076f59507","observation_id":"8080725c-f4ca-44d4-9d04-aba5fff62697","resolution":{"observed_at":"2026-08-10T20:10:20.692587Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.676322Z","title":"Measuring massive multitask language understand- ing, 2021","venue":null,"work_id":"b6f38e22-691b-4c38-aeb1-03cb95452fb9","year":2021},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.357505Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:a506f5d9249248f18abe1ffda10de3205ed6a522e52f3ecd95f7b0a589470544","observation_id":"dfb09f6a-f8e0-40f9-a795-069c674d8187","resolution":{"observed_at":"2026-08-10T20:10:20.680374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.664259Z","title":"Model compression in practice: Lessons learned from practitioners creating on-device machine learning experiences","venue":null,"work_id":"471bafbd-74bc-47f5-aeed-79cfbf326fca","year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.361534Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:4c1acc3cb71654641c310e80d2a012c2efa8bfa5f887d830428c568cb79f6968","observation_id":"80a95704-fc63-431c-9daa-2a7700b5b235","resolution":{"observed_at":"2026-08-10T20:10:20.668675Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.652097Z","title":"A study of bfloat16 for deep learning training, 2019","venue":null,"work_id":"8dbffbdf-8701-4154-9e2b-0c7930a2221c","year":2019},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.365842Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:58df9d84bab2996442deee3e49204681e3e54edcae1acedee776086787846196","observation_id":"42ab462e-ffc6-43a3-97eb-4600a6947d91","resolution":{"observed_at":"2026-08-10T20:10:20.656503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.640695Z","title":"Openai’s ceo says the age of giant ai models is already over, Apr 2023","venue":null,"work_id":"4d5b22c4-fe4e-4949-87be-36b7241ad0bb","year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.370084Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:acfb168d0ee47325c7d27840f4f25982d6797ee5ab7f3d5361cadc5402de3443","observation_id":"66ebcab8-3aea-4cbb-86da-30f120dff344","resolution":{"observed_at":"2026-08-10T20:10:20.644786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.627553Z","title":"Islam, and Shaolei Ren","venue":null,"work_id":"e97f0f31-306b-4326-a80d-323117cafbf4","year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.373912Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:7c09b3a14ef69b1d59ddd2bf0a0622b21e9af5905a28b378fcda3037220afa1f","observation_id":"9e38cdbe-bb44-4dbd-a584-de1fa6f115b0","resolution":{"observed_at":"2026-08-10T20:10:20.632038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.378311Z","title":"Truthfulqa: Measuring how models mimic human falsehoods, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.378311Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:5e49809a46bd0682ff15e195c2bb42af0eebf7330f18d5efc6b9ed7dc7a5e4b1","observation_id":"9d3adadf-ed99-49ce-9c7f-38280762acd4","resolution":{"observed_at":"2026-08-10T20:10:20.378311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.382807Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.382807Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:645ae3dde23c51aaa2d4a46842d8f7e8ffe2dd17b5a05f6d4050980ca2aa0127","observation_id":"246ce983-0234-44c9-b0fb-63cb85becaf0","resolution":{"observed_at":"2026-08-10T20:10:20.382807Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.597027Z","title":"Are sixteen heads really better than one?, 2019","venue":null,"work_id":"b8610b68-4fc3-4775-9b0c-3080c8335ea4","year":2019},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.387227Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:4aef3a5d7c2af12f1f5e32e3546763e0061dc4bf3db80419e5be35076ca7120e","observation_id":"391b524a-2f9f-468b-90e6-df17d384f226","resolution":{"observed_at":"2026-08-10T20:10:20.601335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.584085Z","title":"Compact language models via pruning and knowledge distillation, 2024","venue":null,"work_id":"6b30b37e-ff7c-4ad5-8f1a-ec80bb7f3507","year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.391741Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:96aaa940161488a8824c32e61fad674bbf02bb61942b75eb5acd658173854bdc","observation_id":"24a3387a-59b4-44d7-b0db-faa9cd0e06b8","resolution":{"observed_at":"2026-08-10T20:10:20.588490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.570692Z","title":"Wino- grande: An adversarial winograd schema challenge at scale, 2019","venue":null,"work_id":"8b611b9b-93c6-49d5-8eec-f437d270c4d0","year":2019},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.395375Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:6acde12a74dbd4e4ba3f70acf7fea2222960e85aafc62ac253c775ef56185166","observation_id":"e31bc1dc-ab52-4a6e-941c-4827fc0794ae","resolution":{"observed_at":"2026-08-10T20:10:20.574683Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.398972Z","title":"Distilbert, a distilled version of bert: smaller, faster, cheaper and lighter, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.398972Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:38e5763caccd03fecd6d41f8e08c55891622da3b3b342cc90e2d8b01f8cc951a","observation_id":"ef9c82d6-8232-49ab-bd06-cc1e58e6dd90","resolution":{"observed_at":"2026-08-10T20:10:20.398972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.549234Z","title":"Llm pruning and distillation in practice: The minitron approach, 2024","venue":null,"work_id":"35d2f7a9-336d-49e9-b082-e56e38f31999","year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.402744Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:8985e6b1be281e6e24ec495f4c4b2047f15496596632acf106a4c634b9faa18a","observation_id":"0ed8aff7-5ddb-4a9d-aef1-b534180c4c19","resolution":{"observed_at":"2026-08-10T20:10:20.554220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.406236Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.406236Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:777704b626751566598c2a202b877d3c17e41863a99060e75c06bdb1373bb18a","observation_id":"b8d4c228-3951-428c-a631-c6fd9825221b","resolution":{"observed_at":"2026-08-10T20:10:20.406236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.529270Z","title":"Analyz- ing multi-head self-attention: Specialized heads do the heavy lifting, the rest can be pruned","venue":null,"work_id":"85a9d3b6-2877-4bc3-ab7d-a60a53adef8c","year":2019},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.409796Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:5e185a6b760d175cedc195faadf98f97f7de8fdfdfc758944c2592f6fcf06296","observation_id":"afb37d68-5ecd-4066-9ab9-fd573a0804f9","resolution":{"observed_at":"2026-08-10T20:10:20.533351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.517106Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning, 2024","venue":null,"work_id":"dd810d87-ded4-4816-87b1-bee9b813e967","year":2024},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.413275Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:f0338c075623f1b303602d3261f76560e903568731010de5690253cf0364672c","observation_id":"41172bae-8af3-4d38-9b9e-18b7a030aeda","resolution":{"observed_at":"2026-08-10T20:10:20.521492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T20:10:20.500764Z","title":"Hel- laswag: Can a machine really finish your sentence?, 2019","venue":null,"work_id":"d60c6c0c-9022-4db4-a08d-4b916502861c","year":2019},"citing_paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T20:10:20.416886Z"},"links":{"citing_paper":"/paper/2502.00046"},"observation_digest":"sha256:54e4f0c06724b0535932a9f40a9fbb25a45804228695a5dd7f7e937ad17c79e0","observation_id":"fe0db32b-10d6-4dea-ae52-6ae14ab81a54","resolution":{"observed_at":"2026-08-10T20:10:20.508445Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2502.00046","last_updated":"2025-01-16T08:54:44Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T09:01:37.746502Z","submitted_at":"2025-01-16T08:54:44Z","title":"Optimization Strategies for Enhancing Resource Efficiency in Transformers & Large Language Models"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":14,"verified_exact":0,"verified_fuzzy":13},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2502.00046."}