{"as_of":"2026-08-10T00:25:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6a51c53087689b42cccbedda299558d7b64309bbec2afcc5136b14476107b78c","coverage":[{"denominator":33,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":33,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T17:06:35.243279Z","state":"measured"},{"denominator":33,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":33,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.11953/citation-record","integrity":"/paper/2507.11953/integrity","json":"/paper/2507.11953/citation-record.json","paper":"/paper/2507.11953"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-06T17:06:32.682069Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:32.682069Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:c71992340a2e2a3141a08b45352a78967181e3807622ae82940baeb0b5f918e3","observation_id":"ddce7f71-81e7-4bfd-a628-4677a6f16057","resolution":{"observed_at":"2026-08-06T17:06:32.682069Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10774","snapshot_observed_at":"2026-08-06T17:06:32.753842Z","title":"Lee, Deming Chen, and Tri Dao","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:32.753842Z"},"links":{"cited_paper":"/paper/2401.10774","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:ed5c90c938e15abe74b28fd4a2085f6771f5fd0b9c5b6d027caeafd2813ef0b9","observation_id":"d27b0413-f088-48dd-80fc-b5682c8635b2","resolution":{"observed_at":"2026-08-06T17:06:32.753842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07143","last_updated":"2021-10-14T04:05:25Z","snapshot_observed_at":"2026-08-08T04:38:52.617907Z","submitted_at":"2021-10-14T04:05:25Z","title":"bert2BERT: Towards Reusable Pretrained Language Models","version":1},"cited_work":{"arxiv_id":"2110.07143","doi":null,"metadata_source":"pith","pith_arxiv_id":"2110.07143","snapshot_observed_at":"2026-08-06T17:06:35.705581Z","title":"bert2BERT: Towards Reusable Pretrained Language Models","venue":"cs.CL","work_id":"6803647c-524f-4958-a731-ce45a4cb12be","year":2021},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:32.816564Z"},"links":{"cited_paper":"/paper/2110.07143","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:02fdf56879c62e5ef7492fc798598a6f91273930821b53da11d40a4c426ba296","observation_id":"f2201d20-badd-46f4-9c6e-bbdf0975a507","resolution":{"observed_at":"2026-08-06T17:06:35.789463Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-06T17:06:32.884394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:32.884394Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:5dbeb5374d7adbbee1fb2771d7190b33ebedf6669cf1db67a56583fab91a3631","observation_id":"78e2ff80-2383-4ed6-82c2-cf1fc53818fd","resolution":{"observed_at":"2026-08-06T17:06:32.884394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T17:06:32.936687Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:32.936687Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:0b56caa6d50771722c335352b71ff62035ae8f7e4e767cc360cf5e36950b5b05","observation_id":"031f1f96-1911-4e72-ac5b-db09b890c50e","resolution":{"observed_at":"2026-08-06T17:06:32.936687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19737","last_updated":"2024-04-30T17:33:57Z","snapshot_observed_at":"2026-08-03T23:22:09.849239Z","submitted_at":"2024-04-30T17:33:57Z","title":"Better & Faster Large Language Models via Multi-token Prediction","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19737","snapshot_observed_at":"2026-08-06T17:06:33.019729Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.019729Z"},"links":{"cited_paper":"/paper/2404.19737","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:38b1f234928cd39d3b4da8d597f70d9f7040c64cbf083fa6204d839cfffc8c7d","observation_id":"4f5aa031-7ccc-4838-b0ae-49e0fbad6755","resolution":{"observed_at":"2026-08-06T17:06:33.019729Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T17:06:33.090241Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.090241Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:1bc3f0f0a9e97e6c4e47e9507c545f0ebbe7340fa9b013ae5b97038cf5fe0e36","observation_id":"75bace4f-1661-45df-82a0-84828160eb0d","resolution":{"observed_at":"2026-08-06T17:06:33.090241Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.18079","last_updated":"2025-05-28T18:58:29Z","snapshot_observed_at":"2026-08-09T08:05:16.511956Z","submitted_at":"2024-01-31T18:58:14Z","title":"KVQuant: Towards 10 Million Context Length LLM Inference with KV Cache Quantization","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.18079","snapshot_observed_at":"2026-08-06T17:06:33.153280Z","title":"Mahoney, Yakun Sophia Shao, Kurt Keutzer, and Amir Gholami","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.153280Z"},"links":{"cited_paper":"/paper/2401.18079","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:42bc1684c5cabb47bc13c57ce6516ea99c36bf65f98ad897edc71ec0373248d8","observation_id":"53b5b577-79bb-4a38-8752-585dbd12bc91","resolution":{"observed_at":"2026-08-06T17:06:33.153280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:33.257455Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.257455Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:b32f6bc0068920409ff69f78e2716953fa4b5ce0aabe7009c3fd2b501a381e21","observation_id":"5f539c6a-4fe4-4b54-b4d8-8b731cb81118","resolution":{"observed_at":"2026-08-06T17:06:33.257455Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:33.314979Z","title":"Le, Yonghui Wu, and Zhifeng Chen","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.314979Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:87d4057bd7c474a411b8b4952dcbfec507c35aacd6659cd0d2fb905d8975eded","observation_id":"8749c43c-2823-490c-ad32-138f9817c6e7","resolution":{"observed_at":"2026-08-06T17:06:33.314979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:33.398030Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.398030Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:72df509c05aca60bee77892d9c46e6f2e103393a67dedec46403525a1b3df7de","observation_id":"7e1a6e80-93c7-4856-b09c-292eedb8e4cd","resolution":{"observed_at":"2026-08-06T17:06:33.398030Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-06T17:06:33.490400Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.490400Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:4db27e11788da507a0fa57d358d0f665e7475be41a413c8796dcbbd426d5dbbf","observation_id":"747a2e47-ebf3-4362-a1bb-c91e9e816657","resolution":{"observed_at":"2026-08-06T17:06:33.490400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:33.575699Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.575699Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:ed2dd87c561a8304692b4cc054bb387a8ad97c3c1010e2830990d48f8276c630","observation_id":"881c46c3-0aef-4ff4-abc5-f4f2e8855838","resolution":{"observed_at":"2026-08-06T17:06:33.575699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-06T17:06:33.670665Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.670665Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:0fb1f64314c0c7e209c08428a6393dc9f5d883f6d7d46f5110956b4744addac4","observation_id":"3b9396c2-32b7-4d11-8262-2481c8fbf45c","resolution":{"observed_at":"2026-08-06T17:06:33.670665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T17:06:33.745589Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.745589Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:39802c9db746a08fbc33a9a25fd291d42f3d69fbd130d5d9e12a1cf27e4ca90a","observation_id":"5f9fd941-db81-4ada-be82-f42b8d06fc5a","resolution":{"observed_at":"2026-08-06T17:06:33.745589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:36.031925Z","title":null,"venue":null,"work_id":"f9edc71c-b055-4e44-8b15-9b290256fd64","year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.821288Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:16513c7f84fb9f085f1d5cec7fef854deed7c5a52143ac4239bfc3db485191c9","observation_id":"122e322e-7d23-48bd-a4de-6696608a97a4","resolution":{"observed_at":"2026-08-06T17:06:36.081629Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:33.894797Z","title":"Vicky Zhao, Lili Qiu, and Dongmei Zhang","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.894797Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:1ded4bb0ca4be3666d46173f4d36183a89ca3d556b2d4c529865c9cc17f06f45","observation_id":"843ab966-ea9d-439f-a421-b05b56f66f4e","resolution":{"observed_at":"2026-08-06T17:06:33.894797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.00079","last_updated":"2025-09-03T14:56:29Z","snapshot_observed_at":"2026-08-07T12:08:57.217593Z","submitted_at":"2024-06-24T02:05:32Z","title":"Mooncake: A KVCache-centric Disaggregated Architecture for LLM Serving","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.00079","snapshot_observed_at":"2026-08-06T17:06:33.971861Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:33.971861Z"},"links":{"cited_paper":"/paper/2407.00079","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:4caab40cdd84f5098bf683de0ce31db89a016e04a480d5f6819d5a79b25e3f6f","observation_id":"42bc596e-6c1b-4d5c-90ba-f02346f3abcd","resolution":{"observed_at":"2026-08-06T17:06:33.971861Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-06T08:43:40.051791Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-06T17:06:34.063713Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.063713Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:4a7f9a63b353f588b171af2dd21bdc7445852d44ed2ad936a2057ee97fbe77be","observation_id":"9ff05fd0-0beb-4fe2-b1de-a78e98b0afe0","resolution":{"observed_at":"2026-08-06T17:06:34.063713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-06T17:06:34.181852Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.181852Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:1959a2bc06e63f266ebc14aa6e62527773f70f1f2df2421c554d81b744fe27f9","observation_id":"32e3c357-9e37-4cdf-904e-c874b813e0a0","resolution":{"observed_at":"2026-08-06T17:06:34.181852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.05254","last_updated":"2024-05-09T14:12:45Z","snapshot_observed_at":"2026-08-04T14:59:09.585356Z","submitted_at":"2024-05-08T17:57:39Z","title":"You Only Cache Once: Decoder-Decoder Architectures for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.05254","snapshot_observed_at":"2026-08-06T17:06:34.234433Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.234433Z"},"links":{"cited_paper":"/paper/2405.05254","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:55c12546ba53c1d5c004edefe0aada2bf590646a58464d72c83de8ff1e539571","observation_id":"ef02b930-ad70-4fd8-8ef7-3bc981c325c4","resolution":{"observed_at":"2026-08-06T17:06:34.234433Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:34.307719Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.307719Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:ecf6386fb52212d291fb18f25a4c8c21425e248fe42f3c06d46434fd95b09c1a","observation_id":"d86a8ddf-d8a4-4daf-ad24-362ef31dba0c","resolution":{"observed_at":"2026-08-06T17:06:34.307719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08454","last_updated":"2024-07-21T02:37:11Z","snapshot_observed_at":"2026-07-06T18:44:49.512236Z","submitted_at":"2024-07-11T12:50:42Z","title":"Model Tells You Where to Merge: Adaptive KV Cache Merging for LLMs on Long-Context Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08454","snapshot_observed_at":"2026-08-06T17:06:34.388738Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.388738Z"},"links":{"cited_paper":"/paper/2407.08454","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:80a6bf239c5d4c3e9a9728d7af80fc8347411ed281889c1c43384595c3cc189a","observation_id":"0dd07ab1-e78e-4822-afa8-6174f15c2e8e","resolution":{"observed_at":"2026-08-06T17:06:34.388738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:34.508393Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.508393Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:23ed47f5dfa1e7ae8f8f7a4583b009328a167cd595983518424c9e84e22cdf11","observation_id":"98605f00-7b41-4240-9f92-d3f4cf046fa6","resolution":{"observed_at":"2026-08-06T17:06:34.508393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.16487","last_updated":"2023-10-30T01:36:06Z","snapshot_observed_at":"2026-08-08T01:16:37.122006Z","submitted_at":"2022-03-30T17:27:09Z","title":"Speculative Decoding: Exploiting Speculative Execution for Accelerating Seq2seq Generation","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.16487","snapshot_observed_at":"2026-08-06T17:06:34.603114Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.603114Z"},"links":{"cited_paper":"/paper/2203.16487","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:4b0fb0de22e13cb93337e938d615a911c2f409159f05ca2c6b7a8deb0c7e0d2f","observation_id":"024ec14d-13af-4286-88b8-edf2bc45f38d","resolution":{"observed_at":"2026-08-06T17:06:34.603114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-06T17:06:34.684694Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.684694Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:84ce7cc3d9243ac4670b2d795c52e6e6065b3ffb65a9542cca6ec3afacc3ceed","observation_id":"2f06354c-eacc-4bd2-817f-72b6ed71ebb3","resolution":{"observed_at":"2026-08-06T17:06:34.684694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-06T17:06:34.765386Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.765386Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:4eeb091a5b0e2ed4d71ced84a49063010407f2a94c158c8ac7e29b6a39919579","observation_id":"af505138-7ac9-42ba-afbb-1f5133866f8c","resolution":{"observed_at":"2026-08-06T17:06:34.765386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:34.843258Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.843258Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:a43a506b8835b253486b2f119173d610365dc9d654e0aba07bd6ffed7f6bce4b","observation_id":"264d52de-0845-4177-9c5a-82d06d16a1d6","resolution":{"observed_at":"2026-08-06T17:06:34.843258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-08-09T10:11:58.541007Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-06T17:06:34.915721Z","title":"Cohen, Ruslan Salakhutdinov, and Christopher D","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.915721Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:b72dd584cc58405a5ee415cf3e5d788fc8b525cede611a2c390511c1867b99fc","observation_id":"f1b483d5-96a7-42fe-a269-73873527ec8c","resolution":{"observed_at":"2026-08-06T17:06:34.915721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:34.975662Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:34.975662Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:8ad3fca081287a575fa0407d9599f49414ae25a01324336337fffc832be5322a","observation_id":"ce0c4ed0-b0fe-47a0-abd3-c9bf3479c008","resolution":{"observed_at":"2026-08-06T17:06:34.975662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:35.899881Z","title":null,"venue":null,"work_id":"8bcbafcc-03b1-4c8e-a667-349332f91ea4","year":2023},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:35.039483Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:68c235b05735768177f07ffb1096b545e5ad32efd7a5c43aad1e919630b4f6ec","observation_id":"87ce1964-0ede-499d-aab8-8548b5c3b039","resolution":{"observed_at":"2026-08-06T17:06:35.943605Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:35.145905Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:35.145905Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:b80b6f54e49a9f4aac26986cdce057b3603d2a50793fe8f9dc9672d8639dda62","observation_id":"d0917189-3a92-4a68-a37d-d880cde302e5","resolution":{"observed_at":"2026-08-06T17:06:35.145905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T17:06:35.243279Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T17:06:35.243279Z"},"links":{"citing_paper":"/paper/2507.11953"},"observation_digest":"sha256:49ca994fcfb87ee4f91b2423e2049f88cec56014c6f38dfb2d63fb5f2c510c04","observation_id":"09201d63-7bdc-4812-8495-6600582b6ce4","resolution":{"observed_at":"2026-08-06T17:06:35.243279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.11953","last_updated":"2025-07-16T06:39:11Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-09T05:28:13.139068Z","submitted_at":"2025-07-16T06:39:11Z","title":"IAM: Efficient Inference through Attention Mapping between Different-scale LLMs"},"reference_resolution":{"displayed":33,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":33},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 33 of 33 outbound references and 0 inbound Pith citation observations for arXiv:2507.11953."}