{"as_of":"2026-08-09T06:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:bb15ca07cfca11e9ff04632836b34411b7dbc9bdc0490b62613ba58cfde3eff6","coverage":[{"denominator":67,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":67,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:51:51.687705Z","state":"measured"},{"denominator":73,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":73,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":6,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":6,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T03:36:43.880446Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2602.01167","last_updated":"2026-02-01T11:37:05Z","snapshot_observed_at":"2026-08-01T15:51:00.825079Z","submitted_at":"2026-02-01T11:37:05Z","title":"Do All Individual Layers Help? An Empirical Study of Task-Interfering Layers in Vision-Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-21T14:48:21.212088Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2602.01167"},"observation_digest":"sha256:e69efdb56c8628839f8a6ce6bea35d5a530384e81fb26b56602afbcf83f4ee3c","observation_id":"385cbaf2-4b61-46d3-baba-663a457b67f8","resolution":{"observed_at":"2026-05-21T14:50:15.327483Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-03T03:36:43.880446Z","title":"Cross-modal information flow in multimodal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.07574","last_updated":"2026-05-27T10:39:17Z","snapshot_observed_at":"2026-08-03T03:36:41.635951Z","submitted_at":"2026-02-07T14:46:05Z","title":"ViCA: Efficient Multimodal LLMs with Vision-Only Cross-Attention","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T03:36:43.880446Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2602.07574"},"observation_digest":"sha256:6d58532bb3b6c818582dfc2462e9be15cdeec2d058ea970a63d9804422b205a2","observation_id":"9f8eb748-1179-4bab-a8f9-329a9567700c","resolution":{"observed_at":"2026-08-03T03:36:43.880446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-02T18:16:48.745554Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2603.14785","last_updated":"2026-07-26T17:22:03Z","snapshot_observed_at":"2026-08-07T10:45:57.580648Z","submitted_at":"2026-03-16T03:35:04Z","title":"SkipOPU: An FPGA-based Overlay Processor for Large Language Models with Dynamically Allocated Computation","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T18:16:48.745554Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2603.14785"},"observation_digest":"sha256:daa81cdb9ee7e7976864c176afb63197d68d7d1a97f92851157d12f0433f4646","observation_id":"0b638f52-bda5-4990-90fc-d9e0c9e851c7","resolution":{"observed_at":"2026-08-02T18:16:48.745554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.00523","last_updated":"2026-05-30T04:31:29Z","snapshot_observed_at":"2026-07-06T23:41:15.410587Z","submitted_at":"2026-05-30T04:31:29Z","title":"ProactiveLLM: Learning Active Interaction for Streaming Large Language Models","version":1},"reference_index":115,"source":"arxiv_source","source_observed_at":"2026-06-28T19:07:48.425181Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.00523"},"observation_digest":"sha256:548bf94fea2eb8972f801608d8592417db08ae6f0e968fc3397e182f974df60c","observation_id":"8c46fa90-6f3a-4f91-9a0f-55d937d31d15","resolution":{"observed_at":"2026-06-28T19:12:34.801340Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.26538","last_updated":"2026-06-25T02:25:00Z","snapshot_observed_at":"2026-07-07T00:00:51.779266Z","submitted_at":"2026-06-25T02:25:00Z","title":"CascadeFormer: Depth-Tapered Transformers Motivated by Gradient Fan-in Asymmetry","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-06-26T05:22:26.818078Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.26538"},"observation_digest":"sha256:6e20bbc93b74a1e46a5f74affad86a646f4091ad55715ed936981ec0b1c4ff9d","observation_id":"df16597e-72c9-4aaf-9dd3-92d8d01c3822","resolution":{"observed_at":"2026-06-26T05:29:00.096032Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"cited_work":{"arxiv_id":"2506.04179","doi":"10.48550/arxiv.2506.04179","metadata_source":"arxiv_reference","pith_arxiv_id":"2506.04179","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Skipgpt: Dynamic layer pruning reinvented with token awareness and module decou- pling.CoRR, abs/2506.04179","venue":"ArXiv.org","work_id":"975baf9c-51a0-4c98-93d2-40245457951e","year":2025},"citing_paper":{"arxiv_id":"2606.27743","last_updated":"2026-06-26T05:48:21Z","snapshot_observed_at":"2026-08-05T16:07:01.090621Z","submitted_at":"2026-06-26T05:48:21Z","title":"End-to-End Dynamic Sparsity for Resource-Adaptive LLM Inference","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T03:27:08.181406Z"},"links":{"cited_paper":"/paper/2506.04179","citing_paper":"/paper/2606.27743"},"observation_digest":"sha256:dec850e7bfe1c04ed27ae1b2476148a8cab239df0a7197507c43e20ac571cf00","observation_id":"58de471e-c8c0-4003-841f-75c0c4d1bee2","resolution":{"observed_at":"2026-07-01T17:35:52.025582Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.04179/citation-record","integrity":"/paper/2506.04179/integrity","json":"/paper/2506.04179/citation-record.json","paper":"/paper/2506.04179"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.383918Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.383918Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5dce3313d2952aae4949181a137a26f4edd26f46cb8d8a8899aaa7ff2aa80523","observation_id":"b9a91ac5-7b24-4128-b4a9-98d78d859e90","resolution":{"observed_at":"2026-08-07T10:51:51.383918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.390078Z","title":"Fluctuation-based adaptive structured pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.390078Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d90d2edcdfd737a9cc335e7660d9629f74f5039746d8a7ab366d5c8d7a50734b","observation_id":"85c7b218-6568-4272-a198-914902691727","resolution":{"observed_at":"2026-08-07T10:51:51.390078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-07T10:51:51.394725Z","title":"L., Nascimento, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.394725Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:bf0cf8475cfd717434c54c0c7ef8ae3391322a676e7022d79111deae31d0fbc3","observation_id":"1c87c87a-4c8f-4d5a-b0f4-610e08c82850","resolution":{"observed_at":"2026-08-07T10:51:51.394725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.399546Z","title":"A., Bourne, J","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.399546Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b3340c5e7bab4ea1d3ce4e46df9485661429628dc7c1c47731b5c5cac929dbb8","observation_id":"67f46d71-d247-4032-9029-1972de44a27a","resolution":{"observed_at":"2026-08-07T10:51:51.399546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1308.3432","last_updated":"2013-08-15T15:19:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-08-15T15:19:34Z","title":"Estimating or Propagating Gradients Through Stochastic Neurons for Conditional Computation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1308.3432","snapshot_observed_at":"2026-08-07T10:51:51.403709Z","title":"Estimating or propagating gradients through stochastic neurons for conditional computation","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.403709Z"},"links":{"cited_paper":"/paper/1308.3432","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:cc41377d42954d49770fa0bd145e0c204010012a0ceb7db6b70d9680b8ff362b","observation_id":"1a3c16d1-8058-447a-affa-bbab4f6ab1f2","resolution":{"observed_at":"2026-08-07T10:51:51.403709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.408641Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.408641Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:7fd4d0e1b2af86370fa62675ca225590c05f2d215e221caf9019d7cb37673073","observation_id":"3c8cbd3c-6ae2-4191-8156-ef6656c93417","resolution":{"observed_at":"2026-08-07T10:51:51.408641Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-07T10:51:51.414182Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.414182Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:a77dc0708c84028b4b3af166b8e8928ffdd58d146bbc3e6a1009ed2d236dba81","observation_id":"65c68948-ae3f-4416-98e0-6a28d3eeb0bb","resolution":{"observed_at":"2026-08-07T10:51:51.414182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T10:51:51.419334Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.419334Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:1bd389b346fdf7132cf1ce5c36d995d97195a9fbc2feefcae7bc9d9fb4986f78","observation_id":"3e4ff121-ee0c-41e2-ab1d-93250b6dc3f8","resolution":{"observed_at":"2026-08-07T10:51:51.419334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T10:51:51.424020Z","title":"A survey on mixture of experts, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.424020Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:3e774b3de937587fb2a08e6e89477ae92b58cbfc2c78ba9f87dd9c13ba21eb38","observation_id":"44a512e3-664f-47e8-b6c4-1e23a1b71017","resolution":{"observed_at":"2026-08-07T10:51:51.424020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19135","last_updated":"2025-01-25T00:11:26Z","snapshot_observed_at":"2026-08-08T23:34:03.531276Z","submitted_at":"2024-03-28T04:12:13Z","title":"Streamlining Redundant Layers to Compress Large Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19135","snapshot_observed_at":"2026-08-07T10:51:51.433698Z","title":"Compressing large language models by streamlining the unimportant layer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.433698Z"},"links":{"cited_paper":"/paper/2403.19135","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:cd0e3942d24facd7731e8f8e5b1110a6d56c408baa6bf5132b0e244bc5dc0491","observation_id":"567103ee-da14-48b1-994e-2e33bbada56b","resolution":{"observed_at":"2026-08-07T10:51:51.433698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18001","last_updated":"2025-05-27T02:59:22Z","snapshot_observed_at":"2026-08-07T17:50:44.753700Z","submitted_at":"2025-02-25T09:08:45Z","title":"Unveiling the Key Factors for Distilling Chain-of-Thought Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18001","snapshot_observed_at":"2026-08-07T10:51:51.438165Z","title":"Unveiling the key factors for distilling chain-of-thought reasoning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.438165Z"},"links":{"cited_paper":"/paper/2502.18001","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:7e81605c82e7547eb7f3b3da95a78d7504d3df6167adfb56a4570811f79992b9","observation_id":"86b98c04-287d-430e-810a-5d9c39a29eba","resolution":{"observed_at":"2026-08-07T10:51:51.438165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04916","last_updated":"2024-06-16T08:37:25Z","snapshot_observed_at":"2026-07-06T16:58:43.934362Z","submitted_at":"2023-12-08T09:31:50Z","title":"EE-LLM: Large-Scale Training and Inference of Early-Exit Large Language Models with 3D Parallelism","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04916","snapshot_observed_at":"2026-08-07T10:51:51.442664Z","title":"Ee-llm: Large-scale training and inference of early-exit large language models with 3d parallelism, 2024 c","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.442664Z"},"links":{"cited_paper":"/paper/2312.04916","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:ca30f9fa1e60de8a0e009a2ba598222867115be740c0c3627688716601810312","observation_id":"59cd8c77-c4e2-48e5-9edf-3f6eddce050b","resolution":{"observed_at":"2026-08-07T10:51:51.442664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-07T10:51:51.447085Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.447085Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:589d06a2caf0dc6abce06a6d91dfcf5163d1f71816e6e0d2311b6837f598977a","observation_id":"71cf1183-3754-46b1-9227-b71397be3bfe","resolution":{"observed_at":"2026-08-07T10:51:51.447085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-07T10:51:51.451645Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.451645Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:dea1928bb67dfc7479ee74449a4913aca2b51e2186d682285c3275a64b3b98dd","observation_id":"a1a3d765-047d-485a-bb8d-0ac14c4a1096","resolution":{"observed_at":"2026-08-07T10:51:51.451645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T10:51:51.456217Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.456217Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:9ccce73a0f1d76dc67dbcd38a15cebb7c416e26bc37f134598c30a5a885d77c7","observation_id":"ad860cb4-2897-4d47-93bc-454d33095eb6","resolution":{"observed_at":"2026-08-07T10:51:51.456217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.690263Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":"4dd58b9b-332f-4870-91f7-3f3a7151e7bd","year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.460884Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d47fc369af7507ab3cd8f703fbde52c404077a8e45ec835ab2e3687aad9938b7","observation_id":"e1a419c3-1e09-48a1-9735-38f8230e1542","resolution":{"observed_at":"2026-08-07T10:51:52.695418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02628","last_updated":"2023-07-05T19:59:09Z","snapshot_observed_at":"2026-07-06T15:50:49.116859Z","submitted_at":"2023-07-05T19:59:09Z","title":"SkipDecode: Autoregressive Skip Decoding with Batching and Caching for Efficient LLM Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.02628","snapshot_observed_at":"2026-08-07T10:51:51.465417Z","title":"Skipdecode: Autoregressive skip decoding with batching and caching for efficient llm inference","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.465417Z"},"links":{"cited_paper":"/paper/2307.02628","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:66ad7fc281419d14c0a4e628afa4e4d1ada788ae92153455684f521213b144fb","observation_id":"1e81d5a2-1bf9-4671-b9ad-37fb719fdde5","resolution":{"observed_at":"2026-08-07T10:51:51.465417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T10:51:51.469908Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.469908Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:38f08c5207ec95769b2d2822b71f5d1bc3178cb85f9d997c3cfc3c9f9065eda1","observation_id":"27c2cd37-b471-4ef8-a939-742ea0980d9b","resolution":{"observed_at":"2026-08-07T10:51:51.469908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02181","last_updated":"2024-07-09T11:59:01Z","snapshot_observed_at":"2026-07-06T17:39:16.540553Z","submitted_at":"2024-03-04T16:23:58Z","title":"Not All Layers of LLMs Are Necessary During Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02181","snapshot_observed_at":"2026-08-07T10:51:51.474200Z","title":"Not all layers of llms are necessary during inference, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.474200Z"},"links":{"cited_paper":"/paper/2403.02181","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d747f555b8dffbf9aaca4c2468b6003e17a8563d55dda617b8086be5555a7404","observation_id":"758b547f-5e71-42ed-8775-8fc551ed1a5e","resolution":{"observed_at":"2026-08-07T10:51:51.474200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.478452Z","title":"and Alistarh, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.478452Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:4692f41c5400bb99feb1e63279c5cfdfa3004a6b697296d73eef3ef3220afc08","observation_id":"7bd51590-187b-4617-8788-ee3bce1ab7d4","resolution":{"observed_at":"2026-08-07T10:51:51.478452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.482651Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.482651Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:abe414f12a7b5b878bb4902c5f429eca3e0e5942a5682d58415a96d212fadd86","observation_id":"364f6f5f-86e6-498c-b655-e739447052b5","resolution":{"observed_at":"2026-08-07T10:51:51.482651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2012.14913","last_updated":"2021-09-05T17:32:27Z","snapshot_observed_at":"2026-08-07T23:50:29.977330Z","submitted_at":"2020-12-29T19:12:05Z","title":"Transformer Feed-Forward Layers Are Key-Value Memories","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2012.14913","snapshot_observed_at":"2026-08-07T10:51:51.486953Z","title":"Transformer feed-forward layers are key-value memories, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.486953Z"},"links":{"cited_paper":"/paper/2012.14913","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:fe0dcd2dc1a39065125b4574d9732d37c2bab6b517648192bd56d4e8caaa71c2","observation_id":"1ccf489c-0e36-49ee-835d-589bae8a606b","resolution":{"observed_at":"2026-08-07T10:51:51.486953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-07T10:51:51.491364Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.491364Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:70a5e0b5982c869eac2bd55765611928c4d1368bd956be250d51b9afb3444023","observation_id":"c4e4d684-fa8f-416f-b29c-851b1e4d532f","resolution":{"observed_at":"2026-08-07T10:51:51.491364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.495830Z","title":null,"venue":null,"work_id":null,"year":1954},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.495830Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:fd31b4c5bcaa22fc1a81063043aa337fd4e11c8c2125b1fc9aa4945f7bda1294","observation_id":"abfc2050-4a0d-45b0-a51a-9de5804fed69","resolution":{"observed_at":"2026-08-07T10:51:51.495830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15786","last_updated":"2024-10-17T02:43:35Z","snapshot_observed_at":"2026-08-03T10:43:35.890260Z","submitted_at":"2024-06-22T08:41:48Z","title":"What Matters in Transformers? Not All Attention is Needed","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15786","snapshot_observed_at":"2026-08-07T10:51:51.500204Z","title":"What matters in transformers? not all attention is needed, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.500204Z"},"links":{"cited_paper":"/paper/2406.15786","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:0f32e57a7758c99ed07bf4685107daa84e6677b41ffdde3d67e41108c85a59da","observation_id":"57458ad2-8bdf-4ae1-ab0c-0abbfd4fa9e6","resolution":{"observed_at":"2026-08-07T10:51:51.500204Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.02336","last_updated":"2025-01-04T17:01:30Z","snapshot_observed_at":"2026-07-06T20:16:35.984578Z","submitted_at":"2025-01-04T17:01:30Z","title":"AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference","version":1},"cited_work":{"arxiv_id":"2501.02336","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.02336","snapshot_observed_at":"2026-08-07T10:51:52.148427Z","title":"AdaSkip: Adaptive Sublayer Skipping for Accelerating Long-Context LLM Inference","venue":"cs.CL","work_id":"31f033ac-2877-47b4-a5ae-0120e51a0e81","year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.504854Z"},"links":{"cited_paper":"/paper/2501.02336","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:1da43253bff9fb1083c761e6820fa1a64279fee6b35ef9205c4e6e8139b544ac","observation_id":"5d9032ef-73f0-4afd-9cf3-2e37da695058","resolution":{"observed_at":"2026-08-07T10:51:52.153846Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-07T10:51:51.509419Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.509419Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:1a078904c0e847c7b05e40b11a3bdc034dd7f7f691470294b9ce1f557d984fe9","observation_id":"d8479f21-51b8-4af9-953f-660eb6f9da2c","resolution":{"observed_at":"2026-08-07T10:51:51.509419Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.657152Z","title":"Categorical reparameterization with gumbel-softmax","venue":null,"work_id":"666c9bc9-8072-4c76-8699-29e134e50c4e","year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.514272Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:dd328479cfb3dec9708edd208dd00bf6895e69376a24ad3e903e503e38b07fdd","observation_id":"6d1caabb-9c82-4424-991a-1e4a52d10dad","resolution":{"observed_at":"2026-08-07T10:51:52.661867Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.642310Z","title":null,"venue":null,"work_id":"0bc1fbd8-ff1a-4595-b910-359c572e249b","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.518483Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:691ed6d25c750d6658c55942935ae8ad2a325a9443729c0c0930e3a66cd2c534","observation_id":"0649cc5a-80e9-4a84-b612-c8d638cf1667","resolution":{"observed_at":"2026-08-07T10:51:52.647194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-08-07T23:10:12.222808Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-07T10:51:51.522792Z","title":"Shortened llama: A simple depth pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.522792Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:c46330238c3d12a223fdb0591a616db7a3e754707607fb0ef2c14238fa67b648","observation_id":"08e55413-5296-4b2e-8ddf-2bbbfb434140","resolution":{"observed_at":"2026-08-07T10:51:51.522792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.627357Z","title":"Attention is not only a weight: Analyzing transformers with vector norms","venue":null,"work_id":"fcea0d44-7358-4a9e-aac8-f3a656b25ea3","year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.527078Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:cf2db0ef9b3c6074c5dd7b6fc7b7f72476a05031b64d0fa97f55dd2e7da4e115","observation_id":"5abc13d0-f4da-471c-b819-681ded7b39fb","resolution":{"observed_at":"2026-08-07T10:51:52.632129Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.531435Z","title":"Crafting papers on machine learning","venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.531435Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5f7d6dd19a06cd4d6b422e65cdb78e9266f95b619cafa78aa90e2d8f7f1cce93","observation_id":"54809726-6084-4e2a-af6d-f9ced485ff93","resolution":{"observed_at":"2026-08-07T10:51:51.531435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-07T10:51:51.535857Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.535857Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:a4e088558cf143494f99ce922873500fbcc3e5591bf2b961b6f8dda8104121f1","observation_id":"79118f7e-cfa5-433e-a06b-f998ef0168b7","resolution":{"observed_at":"2026-08-07T10:51:51.535857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-07T10:51:51.540562Z","title":"and Hutter, F","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.540562Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:0c22db9653fc9670c8e90fcf09bed8ebf2cc47427dfa024ed42d7f71e7ddb469","observation_id":"9b63162f-4edb-44c7-9cba-bd987b043aaa","resolution":{"observed_at":"2026-08-07T10:51:51.540562Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.545547Z","title":"Llm-pruner: On the structural pruning of large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.545547Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e8d12b63cf46deb4c6f0fe2868f145eefdd336203760f40463016a37a9eda4c1","observation_id":"4c8584f6-4e45-430f-bd07-74eacc7830e9","resolution":{"observed_at":"2026-08-07T10:51:51.545547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1411.0030","last_updated":"2015-01-26T13:46:52Z","snapshot_observed_at":"2026-07-06T03:59:12.341358Z","submitted_at":"2014-10-31T21:40:50Z","title":"A* Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1411.0030","snapshot_observed_at":"2026-08-07T10:51:51.550043Z","title":"J., Tarlow, D., and Minka, T","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.550043Z"},"links":{"cited_paper":"/paper/1411.0030","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:b29427a429ddccb6e38f89dec0f3858d7f47b697b99968ffd66955184349e2d0","observation_id":"9b8412b4-dcb0-4f6a-bb2c-29d23a98e13c","resolution":{"observed_at":"2026-08-07T10:51:51.550043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.554441Z","title":null,"venue":null,"work_id":null,"year":1993},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.554441Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:515c460d8e4992321b7a9be26974809a9f96eccaee9b7297708c5b2f2082313c","observation_id":"d1254ca6-3c05-41bd-be2e-d6222051a084","resolution":{"observed_at":"2026-08-07T10:51:51.554441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-07T10:51:51.558594Z","title":"Shortgpt: Layers in large language models are more redundant than you expect","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.558594Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:5d97a7eaac11c2949572fb7f1c6099533bdfceab47a564920db1410fa765f731","observation_id":"39bd4f1d-4987-43e3-a356-07cd9f7a1921","resolution":{"observed_at":"2026-08-07T10:51:51.558594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.05262","last_updated":"2023-01-13T15:16:16Z","snapshot_observed_at":"2026-07-06T12:36:34.388460Z","submitted_at":"2022-02-10T18:59:54Z","title":"Locating and Editing Factual Associations in GPT","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.05262","snapshot_observed_at":"2026-08-07T10:51:51.563082Z","title":"Locating and editing factual associations in gpt, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.563082Z"},"links":{"cited_paper":"/paper/2202.05262","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:eab825f0adea1b60f3b4fa8552db349734a4cd23bb66e6731d90d46cc967bea0","observation_id":"a0a6580b-815d-491f-9d5b-e47447f2665e","resolution":{"observed_at":"2026-08-07T10:51:51.563082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-07-06T05:12:10.387914Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-07T10:51:51.567460Z","title":"Pointer sentinel mixture models","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.567460Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:696c4f0721f80622543ccdace94934a466c25f7b7ffddbe52181fc45adce0572","observation_id":"eebd4424-dded-424e-9b4e-c9ffc82c33f7","resolution":{"observed_at":"2026-08-07T10:51:51.567460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16130","last_updated":"2024-04-03T16:27:31Z","snapshot_observed_at":"2026-08-08T01:23:45.628587Z","submitted_at":"2023-05-25T15:04:01Z","title":"Language Models Implement Simple Word2Vec-style Vector Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16130","snapshot_observed_at":"2026-08-07T10:51:51.572272Z","title":"Language models implement simple word2vec-style vector arithmetic, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.572272Z"},"links":{"cited_paper":"/paper/2305.16130","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:2a1a196eb8c0d6cdfde8716a7ceb39f0d19b150e88ffa106c57c27f505169663","observation_id":"c67925a3-5da0-4d95-8f55-64ccc4570217","resolution":{"observed_at":"2026-08-07T10:51:51.572272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.02789","last_updated":"2018-09-08T11:47:16Z","snapshot_observed_at":"2026-08-08T02:19:52.596062Z","submitted_at":"2018-09-08T11:47:16Z","title":"Can a Suit of Armor Conduct Electricity? A New Dataset for Open Book Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.02789","snapshot_observed_at":"2026-08-07T10:51:51.576835Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.576835Z"},"links":{"cited_paper":"/paper/1809.02789","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:af35fd1c0ea1427264efcc93ff95763d7a6b8a78582f6fb6d59dcf464f3146ae","observation_id":"4ce2b429-d578-4770-9ce2-6ad2150ebed0","resolution":{"observed_at":"2026-08-07T10:51:51.576835Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.581218Z","title":"In-context learning and induction heads","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.581218Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:761c2e58d9e0c5514ddefdadd2c42f6013bba2bd520def2c67b47fbc0a2b677a","observation_id":"389ff1c7-a688-42fe-b99c-a2f603a2374f","resolution":{"observed_at":"2026-08-07T10:51:51.581218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T10:51:51.585303Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.585303Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:dc144b80a18929c7ab7d932abb7c6a25b617fb0fe46b5b3faa0b41793f527236","observation_id":"b16e24a0-c1c1-42db-8ee7-a3f9bad809ce","resolution":{"observed_at":"2026-08-07T10:51:51.585303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02258","last_updated":"2024-04-02T19:28:11Z","snapshot_observed_at":"2026-07-06T17:54:47.689340Z","submitted_at":"2024-04-02T19:28:11Z","title":"Mixture-of-Depths: Dynamically allocating compute in transformer-based language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.02258","snapshot_observed_at":"2026-08-07T10:51:51.589682Z","title":"C., and Santoro, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.589682Z"},"links":{"cited_paper":"/paper/2404.02258","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:12bbaf35df2bef30e5091e8b5bc3b7585b692232a1db2d4e58f9eaa52cdd7ca8","observation_id":"0982c9c1-6ca9-4d84-ba1c-c739a1938630","resolution":{"observed_at":"2026-08-07T10:51:51.589682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.594024Z","title":"L., Bhagavatula, C., and Choi, Y","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.594024Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e2c3ce3eb8531afdeda50ef1f52f540d860fbdc1bb3498a95befffad15fae8c8","observation_id":"25bfb0f7-bcdd-4886-8414-e6d0f5840e55","resolution":{"observed_at":"2026-08-07T10:51:51.594024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03003","last_updated":"2023-10-04T17:41:59Z","snapshot_observed_at":"2026-08-06T09:19:39.979327Z","submitted_at":"2023-10-04T17:41:59Z","title":"From Words to Watts: Benchmarking the Energy Costs of Large Language Model Inference","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03003","snapshot_observed_at":"2026-08-07T10:51:51.598371Z","title":"From words to watts: Benchmarking the energy costs of large language model inference, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.598371Z"},"links":{"cited_paper":"/paper/2310.03003","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e053b4933c64b2c373fe8342123ccf245b0a0db0ebde24d2a52b4aad8e4d68b9","observation_id":"ac2d0f5c-1f4b-43ce-b5ec-f955e944b69f","resolution":{"observed_at":"2026-08-07T10:51:51.598371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.568573Z","title":"Confident adaptive language modeling","venue":null,"work_id":"e4a4b12a-da15-4523-b300-ecf184da0164","year":2022},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.602905Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:46a351662679b88134b0dadc7464f5b849b321327b660bc35a1c1af62986f4b1","observation_id":"6465e8e1-1279-4512-9075-4d31891bf671","resolution":{"observed_at":"2026-08-07T10:51:52.573169Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.16286","last_updated":"2024-07-23T08:40:27Z","snapshot_observed_at":"2026-08-06T09:55:47.794512Z","submitted_at":"2024-07-23T08:40:27Z","title":"A deeper look at depth pruning of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.16286","snapshot_observed_at":"2026-08-07T10:51:51.607178Z","title":"A., Dong, X., Heinrich, G., Breuel, T., Kautz, J., Krueger, D., and Molchanov, P","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.607178Z"},"links":{"cited_paper":"/paper/2407.16286","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:546e73a848d0bf536752cf96be5754bc304c3647a256e8263d1b65a6c95ea9d0","observation_id":"81592bf1-f8b0-46af-b943-035313db2e30","resolution":{"observed_at":"2026-08-07T10:51:51.607178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09025","last_updated":"2024-12-13T02:44:34Z","snapshot_observed_at":"2026-07-06T17:29:56.393307Z","submitted_at":"2024-02-14T09:01:13Z","title":"SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer Blocks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09025","snapshot_observed_at":"2026-08-07T10:51:51.611505Z","title":"Sleb: Streamlining llms through redundancy verification and elimination of transformer blocks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.611505Z"},"links":{"cited_paper":"/paper/2402.09025","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:89d03d36ca65f0637c074c34e9eb7921d4f3e7d0c3de6d739c54b78d61341015","observation_id":"5b973fc4-827a-4292-85b3-0f0987a2249b","resolution":{"observed_at":"2026-08-07T10:51:51.611505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T10:51:51.616024Z","title":"Llama: Open and efficient foundation language models, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.616024Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:3baca9d981ae5c33858c7a8d01f1eaec99b8740ad9f0f502b0ce003326c986fa","observation_id":"0c71b8e6-4aef-4efa-a5ab-84932d71a32e","resolution":{"observed_at":"2026-08-07T10:51:51.616024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T10:51:51.620475Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.620475Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:a79f0559d028884a2c54287200e257e99feb91ad7ac4af811aab3a4e2f18b758","observation_id":"6df09788-7a3c-44f3-8680-fe9326680144","resolution":{"observed_at":"2026-08-07T10:51:51.620475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18581","last_updated":"2023-11-07T05:44:17Z","snapshot_observed_at":"2026-07-06T16:39:48.771285Z","submitted_at":"2023-10-28T04:07:58Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","version":2},"cited_work":{"arxiv_id":"2310.18581","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.18581","snapshot_observed_at":"2026-08-07T10:51:51.885648Z","title":"Accelerating LLaMA Inference by Enabling Intermediate Layer Decoding via Instruction Tuning with LITE","venue":"cs.CL","work_id":"12f2f27c-b18f-4947-b8f3-7217ef251e30","year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.624737Z"},"links":{"cited_paper":"/paper/2310.18581","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:14956eee027028300a3252abe49427bccc125c9230de14faa8cfe09d85599304","observation_id":"9db35863-6b2f-4f01-b7da-f586531836fe","resolution":{"observed_at":"2026-08-07T10:51:51.890716Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:51.629304Z","title":"N., Kaiser, L","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.629304Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:fec7e4bf32ffbc5d1d31dd1cd2874c86283ee664427342b74076b9035dab2bab","observation_id":"1bd9520c-03a4-45dd-ba5f-09427cb3ef43","resolution":{"observed_at":"2026-08-07T10:51:51.629304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03863","last_updated":"2024-05-23T06:08:37Z","snapshot_observed_at":"2026-08-02T01:09:26.116796Z","submitted_at":"2023-12-06T19:18:42Z","title":"Efficient Large Language Models: A Survey","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.03863","snapshot_observed_at":"2026-08-07T10:51:51.633694Z","title":"Efficient large language models: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.633694Z"},"links":{"cited_paper":"/paper/2312.03863","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:21675fdd7e0f0c32fdcc95c6b7f295f65a31650e27e954491db25637333d43b9","observation_id":"d6b78270-85ac-48e4-8724-6d02e4619f28","resolution":{"observed_at":"2026-08-07T10:51:51.633694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.09485","last_updated":"2018-07-25T06:13:24Z","snapshot_observed_at":"2026-08-03T17:15:06.917179Z","submitted_at":"2017-11-26T23:03:37Z","title":"SkipNet: Learning Dynamic Routing in Convolutional Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.09485","snapshot_observed_at":"2026-08-07T10:51:51.638326Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.638326Z"},"links":{"cited_paper":"/paper/1711.09485","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:cc1a9d708237e35b737b3b92995b78dc4f2eafe22c417fdea77c404f6d6a0c2c","observation_id":"3db335a5-80ab-45da-8228-8af86a885a96","resolution":{"observed_at":"2026-08-07T10:51:51.638326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.11903","last_updated":"2023-01-10T23:07:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-28T02:33:07Z","title":"Chain-of-Thought Prompting Elicits Reasoning in Large Language Models","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.11903","snapshot_observed_at":"2026-08-07T10:51:51.643273Z","title":"Chain-of-thought prompting elicits reasoning in large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.643273Z"},"links":{"cited_paper":"/paper/2201.11903","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:9db975e5afa8320385bbecf9f95ceb112f35bf9f1eed5252e13ff3b9d21f9d9f","observation_id":"620cf30b-06b6-4e6a-be4d-5ecac84743da","resolution":{"observed_at":"2026-08-07T10:51:51.643273Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-07T10:51:51.647844Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.647844Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d5f962e7887b29e1b0c780bd98bbd13a7dcfd7199404a6bb153dd1ee4260bf7f","observation_id":"f77f889f-2dd9-45c8-b9f2-72365a5c2adb","resolution":{"observed_at":"2026-08-07T10:51:51.647844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.545464Z","title":"Llmcdsr: Enhancing cross-domain sequential recommendation with large language models","venue":null,"work_id":"6d1d13e9-0ace-43fb-ab4c-7b0e8f75cab7","year":2025},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.652195Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d732d6f3a1518e58dbc063240f2ed9a865fccc9f9d0f223d3f6e5d318d15546a","observation_id":"adb616ff-7897-4ee0-9337-b5581c307a1f","resolution":{"observed_at":"2026-08-07T10:51:52.550467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11187","last_updated":"2024-10-15T01:58:58Z","snapshot_observed_at":"2026-08-02T23:45:33.761426Z","submitted_at":"2024-02-17T04:16:30Z","title":"LaCo: Large Language Model Pruning via Layer Collapse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11187","snapshot_observed_at":"2026-08-07T10:51:51.656370Z","title":"Laco: Large language model pruning via layer collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.656370Z"},"links":{"cited_paper":"/paper/2402.11187","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:6c1319222c99ee9784e93950dd714611b1455df141b540c3fa8158ff381818bc","observation_id":"cfdedba0-f9df-4cc3-a173-0be35f3f733e","resolution":{"observed_at":"2026-08-07T10:51:51.656370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.530732Z","title":"Jump to conclusions: Short-cutting transformers with linear transformations","venue":null,"work_id":"f3f15485-09ca-41f1-8f85-edf34240ac29","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.660698Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:1467b96a94de1f2f51fe382746f799d1b815b9296219873436270f918a14e117","observation_id":"e874a923-5978-4797-a718-667fd4a9fdce","resolution":{"observed_at":"2026-08-07T10:51:52.535639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-07T10:51:51.665131Z","title":"Hellaswag: Can a machine really finish your sentence? arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.665131Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:016c833cc220331cfa5400d85c93565ddb34545ee29a74c42464a49b6b7719b7","observation_id":"c94b92bf-9967-4071-a714-347db78a2237","resolution":{"observed_at":"2026-08-07T10:51:51.665131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15436","last_updated":"2023-11-26T21:45:53Z","snapshot_observed_at":"2026-07-06T16:52:49.773956Z","submitted_at":"2023-11-26T21:45:53Z","title":"Learning to Skip for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15436","snapshot_observed_at":"2026-08-07T10:51:51.669918Z","title":"Learning to skip for language modeling, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.669918Z"},"links":{"cited_paper":"/paper/2311.15436","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:c87d8fc11e21f6c8a5452c04a92faa87a902ef293c23a0e6d1bb30659f2919eb","observation_id":"75111c31-4174-43dc-b107-f845284d354a","resolution":{"observed_at":"2026-08-07T10:51:51.669918Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18218","last_updated":"2024-10-20T09:10:25Z","snapshot_observed_at":"2026-08-06T18:43:32.229808Z","submitted_at":"2024-05-28T14:21:15Z","title":"FinerCut: Finer-grained Interpretable Layer Pruning for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18218","snapshot_observed_at":"2026-08-07T10:51:51.674338Z","title":"Finercut: Finer-grained interpretable layer pruning for large language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.674338Z"},"links":{"cited_paper":"/paper/2405.18218","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:bf31619b933fd5e03b8788a2ba0a13a6893b6fd5d7f62b43161a66ccde06b9ad","observation_id":"ed1fbe4e-1023-4944-866e-4d7844fb6999","resolution":{"observed_at":"2026-08-07T10:51:51.674338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17011","last_updated":"2024-10-09T08:58:40Z","snapshot_observed_at":"2026-08-08T19:40:09.920174Z","submitted_at":"2024-07-24T05:26:52Z","title":"Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism","version":2},"cited_work":{"arxiv_id":"2407.17011","doi":null,"metadata_source":"pith","pith_arxiv_id":"2407.17011","snapshot_observed_at":"2026-08-07T10:51:51.748054Z","title":"Unveiling In-Context Learning: A Coordinate System to Understand Its Working Mechanism","venue":"cs.CL","work_id":"989d90b9-b679-40da-8f08-826e37f98a6c","year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.678910Z"},"links":{"cited_paper":"/paper/2407.17011","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:e8fd68eccb1cb95b2216c5d59b247e8245babc7633cedeca0ab1a4caf07fb7ef","observation_id":"7d14d098-babc-451a-b4ff-7eaa3f9312cd","resolution":{"observed_at":"2026-08-07T10:51:51.755863Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16554","last_updated":"2024-06-24T11:43:07Z","snapshot_observed_at":"2026-08-07T07:41:30.267453Z","submitted_at":"2024-06-24T11:43:07Z","title":"LLaMA-MoE: Building Mixture-of-Experts from LLaMA with Continual Pre-training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16554","snapshot_observed_at":"2026-08-07T10:51:51.683200Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre-training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.683200Z"},"links":{"cited_paper":"/paper/2406.16554","citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:333735f1fe4ec20b9d094edee3a83a4d32007b84e49178a7832a98f2823a4866","observation_id":"98eb3340-97d0-4814-a797-4655cb23ce42","resolution":{"observed_at":"2026-08-07T10:51:51.683200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:51:52.514878Z","title":"Aligning books and movies: Towards story-like visual explanations by watching movies and reading books","venue":null,"work_id":"c9e24da4-08b4-4737-ab4b-3533e379f8e1","year":2015},"citing_paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling","version":1},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T10:51:51.687705Z"},"links":{"citing_paper":"/paper/2506.04179"},"observation_digest":"sha256:d5578dd3ee25df40fea04d8c4cc62fa53e4e2202b11de497994908ea46226dfa","observation_id":"32cf3760-6124-4f49-b387-c1a692a0a5c2","resolution":{"observed_at":"2026-08-07T10:51:52.521096Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.04179","last_updated":"2025-06-04T17:26:31Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T19:35:37.122227Z","submitted_at":"2025-06-04T17:26:31Z","title":"SkipGPT: Dynamic Layer Pruning Reinvented with Token Awareness and Module Decoupling"},"reference_resolution":{"displayed":67,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":3,"verified_fuzzy":7},"total_outbound_references":67},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 67 of 67 outbound references and 6 inbound Pith citation observations for arXiv:2506.04179."}