{"as_of":"2026-08-13T07:31:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6f3db5366e25bf8f6767f92a8342f9630c3c04c28f3321d7311421e749bf594d","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T23:19:23.112017Z","state":"measured"},{"denominator":31,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":31,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.20677/citation-record","integrity":"/paper/2412.20677/integrity","json":"/paper/2412.20677/citation-record.json","paper":"/paper/2412.20677"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-10T23:19:22.995212Z","title":"Boolq: Exploring the surprising diffi- culty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.995212Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:9a54e80a399204acc91ec1928f9501158cd7637d1cf633849646ab20e6ed6486","observation_id":"7151ea51-0361-4590-87fa-d8dec4883b12","resolution":{"observed_at":"2026-08-10T23:19:22.995212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.520907Z","title":null,"venue":null,"work_id":"cc228a2b-d525-48db-a8b4-037e453f8131","year":1954},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.107616Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:df4a4af5c8a46f0520370d5154749203a82a311ad9a7cf9171c39db88af838b7","observation_id":"7fbde293-76e1-4a51-b55a-3fe3ccb88c84","resolution":{"observed_at":"2026-08-10T23:19:23.525027Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T23:19:23.014442Z","title":"Edward J Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.014442Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:e556c7d04f103594f9bd2864218fe5e580fa955aa125f67feb3e914e8982f3dd","observation_id":"7fe3f08a-d2e1-4909-a378-f717391ae2a3","resolution":{"observed_at":"2026-08-10T23:19:23.014442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-10T23:19:23.019925Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.019925Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:64f6e65ba18c0a857667b284d4a8ad2b8c1a7039ecf5febabb7f3401a7206e55","observation_id":"343c113a-3b63-4898-b0d8-2cb8df6d0ffa","resolution":{"observed_at":"2026-08-10T23:19:23.019925Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.13555","last_updated":"2025-02-18T00:14:57Z","snapshot_observed_at":"2026-08-12T23:39:12.044521Z","submitted_at":"2024-06-19T13:44:56Z","title":"BiLD: Bi-directional Logits Difference Loss for Large Language Model Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.13555","snapshot_observed_at":"2026-08-10T23:19:23.024524Z","title":"Bild: Bi- directional logits difference loss for large language model distillation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.024524Z"},"links":{"cited_paper":"/paper/2406.13555","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:dd9ee2a792e3fd7c3ff3e38631e3816016f4d9e4a3072a2a536771c2f7fae8bc","observation_id":"acebbc93-a900-4ccf-87e8-8f88b18c52f5","resolution":{"observed_at":"2026-08-10T23:19:23.024524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-10T23:19:23.028493Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.028493Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:00a519db7afb2ccd1b314b0480e70d840f24e0a3f6b6ff3896902244194f20ec","observation_id":"a489ebb9-8328-4c56-8ea7-5a33c9091de7","resolution":{"observed_at":"2026-08-10T23:19:23.028493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.01312","last_updated":"2018-06-22T14:54:59Z","snapshot_observed_at":"2026-08-12T23:03:36.254662Z","submitted_at":"2017-12-04T19:20:27Z","title":"Learning Sparse Neural Networks through $L_0$ Regularization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.01312","snapshot_observed_at":"2026-08-10T23:19:23.032946Z","title":"Learning sparse neural networks through l_0 regular- ization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.032946Z"},"links":{"cited_paper":"/paper/1712.01312","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:36a75c1b759c7f4f89cf9b6ec23d62fa9255ac878ae75b5a10501d07685c1a8f","observation_id":"3b049843-b8fb-466d-a225-3f858b14dfa8","resolution":{"observed_at":"2026-08-10T23:19:23.032946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09728","last_updated":"2019-09-09T17:29:55Z","snapshot_observed_at":"2026-08-12T21:45:41.485479Z","submitted_at":"2019-04-22T05:36:37Z","title":"SocialIQA: Commonsense Reasoning about Social Interactions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09728","snapshot_observed_at":"2026-08-10T23:19:23.040939Z","title":"Socialiqa: Commonsense reasoning about social interactions","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.040939Z"},"links":{"cited_paper":"/paper/1904.09728","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:21809ffc6dd7a1b75de8d68f2c6425cb99a612a5ab40544d8000af6484c28cba","observation_id":"b7705666-0266-47cd-b997-559697d8ccb8","resolution":{"observed_at":"2026-08-10T23:19:23.040939Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.548020Z","title":"Recursive deep models for se- mantic compositionality over a sentiment treebank","venue":null,"work_id":"7cb60c1c-0018-405f-8dd2-1a9f77cf5c08","year":2013},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.049613Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:14e9dbc98510bd695f352eb77cb7e29669d1782b0302021343f73cc76a137cb5","observation_id":"3f5afc6e-3c90-4e81-97b4-c96794f439e1","resolution":{"observed_at":"2026-08-10T23:19:23.552556Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11695","last_updated":"2024-05-06T17:47:01Z","snapshot_observed_at":"2026-08-13T04:32:33.562415Z","submitted_at":"2023-06-20T17:18:20Z","title":"A Simple and Effective Pruning Approach for Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11695","snapshot_observed_at":"2026-08-10T23:19:23.053957Z","title":"A simple and effective pruning approach for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.053957Z"},"links":{"cited_paper":"/paper/2306.11695","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:8d555295c01596a3a2a1a114ad0ce821b1a1e955cd8238c60ac39560f32f1978","observation_id":"45404514-2a8d-4b1b-9869-eafcc5300f46","resolution":{"observed_at":"2026-08-10T23:19:23.053957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.15891","last_updated":"2024-07-22T01:12:23Z","snapshot_observed_at":"2026-08-12T23:17:40.204038Z","submitted_at":"2024-07-22T01:12:23Z","title":"RazorAttention: Efficient KV Cache Compression Through Retrieval Heads","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.15891","snapshot_observed_at":"2026-08-10T23:19:23.058774Z","title":"Razoratten- tion: Efficient kv cache compression through retrieval heads","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.058774Z"},"links":{"cited_paper":"/paper/2407.15891","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:f9e9291eef635166c3c40aec429bb2be54216956af43141aa48879169eaee6a5","observation_id":"d7f1e43b-321b-4635-a518-8a98c59e813f","resolution":{"observed_at":"2026-08-10T23:19:23.058774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T23:19:23.063117Z","title":"Llama 2: Open foundation and fine- tuned chat models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.063117Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:dad378d111133d1e682f54c3875719bbe77f7c7b33c7e8af119e7c77767ca49a","observation_id":"b62e7200-aa4a-4488-a2bc-c7cbe7f77dd2","resolution":{"observed_at":"2026-08-10T23:19:23.063117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.04732","last_updated":"2021-03-28T19:04:25Z","snapshot_observed_at":"2026-08-10T16:10:22.339531Z","submitted_at":"2019-10-10T17:44:18Z","title":"Structured Pruning of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.04732","snapshot_observed_at":"2026-08-10T23:19:23.067137Z","title":"neurips.cc/paper_files/paper/2017/file/ 3f5ee243547dee91fbd053c1c4a845aa-Paper","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.067137Z"},"links":{"cited_paper":"/paper/1910.04732","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:18b027f95c40f7aef01ee6dcad3c54702256db1447e219328c77ff7ab3f8f436","observation_id":"a5f7f156-3956-4295-bb7e-95440dce08e5","resolution":{"observed_at":"2026-08-10T23:19:23.067137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-13T05:52:56.563579Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-10T23:19:23.075700Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.075700Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:49068898e4b6584697c36d595114b1726d3a764b37f15652e338e738301146dc","observation_id":"62655e4c-e53d-406b-8e09-a916ae36eb06","resolution":{"observed_at":"2026-08-10T23:19:23.075700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-10T23:19:23.080312Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.080312Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:5a7e069de65a335622de5c651ab03519a21d9fcfb99906efd323c3f55322d4f7","observation_id":"948d91bc-580f-4a81-9f94-579e967b72e8","resolution":{"observed_at":"2026-08-10T23:19:23.080312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07056","last_updated":"2024-06-11T08:37:33Z","snapshot_observed_at":"2026-08-12T23:45:46.624428Z","submitted_at":"2024-06-11T08:37:33Z","title":"Effectively Compress KV Heads for LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07056","snapshot_observed_at":"2026-08-10T23:19:23.084595Z","title":"Effectively compress kv heads for llm","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.084595Z"},"links":{"cited_paper":"/paper/2406.07056","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:e12e42fe142cf44f57f3dcf575f30d8f0678e34562b3519138ee4437077717d0","observation_id":"e49414fa-1196-4d67-903c-894eef64356b","resolution":{"observed_at":"2026-08-10T23:19:23.084595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12065","last_updated":"2024-02-20T08:48:24Z","snapshot_observed_at":"2026-08-13T04:15:31.066686Z","submitted_at":"2024-02-19T11:33:21Z","title":"WKVQuant: Quantizing Weight and Key/Value Cache for Large Language Models Gains More","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12065","snapshot_observed_at":"2026-08-10T23:19:23.089199Z","title":"Wkvquant: Quantizing weight and key/value cache for large language models gains more","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.089199Z"},"links":{"cited_paper":"/paper/2402.12065","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:3a3d8f7277a80917a15d6868cb6467053352592eeac93420ef45b8090d94fe1a","observation_id":"674a44b1-e114-4054-9095-f3990fc287f5","resolution":{"observed_at":"2026-08-10T23:19:23.089199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-08-10T16:18:23.994244Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-10T23:19:23.093364Z","title":"Hellaswag: Can a ma- chine really finish your sentence? arXiv preprint arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.093364Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:ccdef1edf8c35832df6d0b65c3487b26ae6aa508d6b319920dba0a5948635dd4","observation_id":"831db064-129f-4930-bd18-0ab67374e58c","resolution":{"observed_at":"2026-08-10T23:19:23.093364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02385","snapshot_observed_at":"2026-08-10T23:19:23.097981Z","title":"Tinyllama: An open-source small language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.097981Z"},"links":{"cited_paper":"/paper/2401.02385","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:6874d5ffef306ac77921b8784c74f34e240ce53c1292c6ab527fc3c24d1151e0","observation_id":"780554e5-c090-4460-85f1-7df43cb64211","resolution":{"observed_at":"2026-08-10T23:19:23.097981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.533787Z","title":"During the pruning training process, the sparsity warm-up steps account for 30% of the total steps, during which the target size of the L0 masks decreases linearly to zero","venue":null,"work_id":"f21b9cb2-343d-4fcc-bf2c-06294f75036b","year":2024},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.102598Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:40ee54332bc9e92a5d600d731de316552504c9bcb1087b237b4eba6e2ecf0256","observation_id":"61840526-4f67-4146-bf65-83deef55c602","resolution":{"observed_at":"2026-08-10T23:19:23.539292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.505567Z","title":null,"venue":null,"work_id":"36306514-7e0f-4ffc-be5a-349978e78eb1","year":2017},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.112017Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:7080bdc460f28ee8e7bd3ba28dd8e113164e1907cf08e8c3e8d663617bfae714","observation_id":"eac5dce5-d74b-4b33-85f6-e1199cb4fd14","resolution":{"observed_at":"2026-08-10T23:19:23.511078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T23:19:23.045321Z","title":"Fast transformer decoding: One write-head is all you need","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":1966,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.045321Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:ac8b0a53df78fef5909780fce6805129286d4a590d2f6573e50346fffd139a35","observation_id":"ab5f951b-3fd8-45ef-87d6-b0e6d373263d","resolution":{"observed_at":"2026-08-10T23:19:23.045321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06567","last_updated":"2024-12-07T13:23:39Z","snapshot_observed_at":"2026-08-12T23:51:34.827651Z","submitted_at":"2024-06-03T13:28:43Z","title":"DHA: Learning Decoupled-Head Attention from Transformer Checkpoints via Adaptive Heads Fusion","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06567","snapshot_observed_at":"2026-08-10T23:19:22.990805Z","title":"Dha: Learning decoupled-head attention from trans- former checkpoints via adaptive heads fusion","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.990805Z"},"links":{"cited_paper":"/paper/2406.06567","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:2a4a169d11b39db4c7686fe40c41bf47730efa88435f5ba3583ea684916a56a9","observation_id":"b3067072-352b-47bb-8ca1-7faa285b5a07","resolution":{"observed_at":"2026-08-10T23:19:22.990805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-10T23:19:23.037009Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.037009Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:5b399a7fec804d41f5683901399fb60f96bb9eca1cbca424401ebb813402285c","observation_id":"9b327448-53b0-48e8-b877-aeb244b96897","resolution":{"observed_at":"2026-08-10T23:19:23.037009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T23:19:23.004497Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.004497Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:7de8cbdbe370a05a78924ede6120fbcd3a62fd157b0c465d83d9ef28b821c869","observation_id":"d5bbf37a-8162-4973-9119-fb744a724811","resolution":{"observed_at":"2026-08-10T23:19:23.004497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-10T23:19:22.999949Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.999949Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:3f8e9276e1acf7089d1dd9a2f47a15f17db49902b51baa684043a4b1bd050380","observation_id":"2f2fc995-ba2a-41ca-8213-8f1f88cd251e","resolution":{"observed_at":"2026-08-10T23:19:22.999949Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T23:19:23.561640Z","title":"Lan- guage models are few-shot learners","venue":null,"work_id":"df7a9d24-b598-4621-942f-665edff24cf4","year":1901},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.986705Z"},"links":{"citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:671eb8ac9a3a6f179c5fa31c33fdc0ea81356bf005fc7c6bdbb8c543de901adb","observation_id":"cf5d0739-4783-4149-ab55-ad05197b6b36","resolution":{"observed_at":"2026-08-10T23:19:23.566901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-10T23:19:23.009235Z","title":"Measuring massive multitask language understand- ing","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.009235Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:94b1332b4df2245d4c2a6a6d32db7c8542affef81283302b1ec15ea64714158f","observation_id":"ad30bf8b-f329-46cd-9743-077854a87204","resolution":{"observed_at":"2026-08-10T23:19:23.009235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.00408","last_updated":"2022-05-02T19:21:13Z","snapshot_observed_at":"2026-08-02T16:36:17.936691Z","submitted_at":"2022-04-01T13:09:56Z","title":"Structured Pruning Learns Compact and Accurate Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.00408","snapshot_observed_at":"2026-08-10T23:19:23.071189Z","title":"[Online; accessed 24-October-2024]","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:23.071189Z"},"links":{"cited_paper":"/paper/2204.00408","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:f7c061637567f0a5ce8769b91a392b388768a858aefcb78b6c800f50068913e0","observation_id":"6aaea453-9a7a-4c1b-810d-ebbda686b8bd","resolution":{"observed_at":"2026-08-10T23:19:23.071189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-08-13T04:33:54.170151Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-10T23:19:22.982078Z","title":"Slicegpt: Compress large language mod- els by deleting rows and columns","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.982078Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:b9ec1a07809272c8fd256896040d166fc91c1d79ccbd79838f00309e51f3e43c","observation_id":"a5f98dbc-0d0f-4192-a531-e065ae2d4a72","resolution":{"observed_at":"2026-08-10T23:19:22.982078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T23:19:22.976195Z","title":"Gqa: Training generalized multi-query transformer models from multi-head checkpoints","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T23:19:22.976195Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2412.20677"},"observation_digest":"sha256:8c8e1bfa44e1d926f3f0f4a5861e54f0126f0a7a5b7951427ff2e838eb805a9a","observation_id":"2aca0bbe-26d1-4b46-a4b5-fbdb433eec82","resolution":{"observed_at":"2026-08-10T23:19:22.976195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.20677","last_updated":"2025-07-26T13:33:06Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T00:50:25.721383Z","submitted_at":"2024-12-30T03:05:45Z","title":"Align Attention Heads Before Merging Them: An Effective Way for Converting MHA to GQA"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":28,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 0 inbound Pith citation observations for arXiv:2412.20677."}