{"as_of":"2026-08-07T21:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ea46035a55bbc43257ae7ada765ed804601abd7b3dec7822c46e98922231e25f","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T22:53:11.677172Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T08:11:52.402271Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.20480","snapshot_observed_at":"2026-08-04T08:11:52.402271Z","title":"Gptailor: Large language model pruning through layer cutting and stitching","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2510.22228","last_updated":"2026-07-20T17:30:01Z","snapshot_observed_at":"2026-08-04T08:11:48.838546Z","submitted_at":"2025-10-25T09:22:22Z","title":"When Fewer Layers Break More Chains: Layer Pruning Harms Test-Time Scaling in LLMs","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T08:11:52.402271Z"},"links":{"cited_paper":"/paper/2506.20480","citing_paper":"/paper/2510.22228"},"observation_digest":"sha256:8a272acb48cbf1235e956989327124e118eca6e1dc913a4242c4d15fae3cb2c1","observation_id":"47ceea1d-3a54-4204-95d5-71d1de949ea4","resolution":{"observed_at":"2026-08-04T08:11:52.402271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.20480/citation-record","integrity":"/paper/2506.20480/integrity","json":"/paper/2506.20480/citation-record.json","paper":"/paper/2506.20480"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-06T22:53:05.965400Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:05.965400Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:455d2c2e00afe573c69531dc8aa57a52b7e82a4602c4ed4b9c30454cd4f4e45b","observation_id":"4279e4b9-21ca-46fa-94f3-cada9e133624","resolution":{"observed_at":"2026-08-06T22:53:05.965400Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T22:53:06.019934Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.019934Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:f7aa88013fd5c4ea94a0656ecfa4d626a4d719047da6bf7b4c7c30589349eddc","observation_id":"f7f13a99-1c85-4bdd-b689-b62e5ec583bc","resolution":{"observed_at":"2026-08-06T22:53:06.019934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.091501Z","title":"Vicuna: An open-source chatbot impressing gpt-4 with 90%* chatgpt quality.See https://vicuna","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.091501Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c51142baa8c614cd8b1415e90aeffbdeb5b5a954fff08b092b5051da32ffba7e","observation_id":"a01ffc72-89e7-4d0b-a202-20d7693dd302","resolution":{"observed_at":"2026-08-06T22:53:06.091501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-06T22:53:06.144314Z","title":"Scaling laws for neural language models.arXiv preprint arXiv:2001.08361, 2020","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.144314Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:1ca58241b45684e0b249b37519d6388cfa6704779b6208f4f0ce252430a4c385","observation_id":"2db738bf-7a44-401d-9cb0-b1ef775bb4da","resolution":{"observed_at":"2026-08-06T22:53:06.144314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-06T22:53:06.218136Z","title":"Training compute-optimal large language models.arXiv preprint arXiv:2203.15556, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.218136Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:ac755a534eeee9afc0b4d6e25e78e3c2e6c2ecedeb74634d6206d79a386ea968","observation_id":"9f77f77d-fd1c-43c7-bd11-457715cff51e","resolution":{"observed_at":"2026-08-06T22:53:06.218136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-02T15:56:35.249569Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.07682","snapshot_observed_at":"2026-08-06T22:53:06.266468Z","title":"Emergent abilities of large language models.arXiv preprint arXiv:2206.07682, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.266468Z"},"links":{"cited_paper":"/paper/2206.07682","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:a8e08288ec40d1b1b3e98c0243b8677309dece947ddbdad4213892ef93d28a2f","observation_id":"37b81a4a-c2bf-4eb4-956f-4b92f8448e5c","resolution":{"observed_at":"2026-08-06T22:53:06.266468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.728129Z","title":"Learning and generalization in overparame- terized neural networks, going beyond two layers.Advances in neural information processing systems, 32, 2019","venue":null,"work_id":"b26a9715-744a-48ca-bca7-3fcc9d19c7d4","year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.328184Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:22447435a81de01cecc8a0bae9599e1e890dfac357b91472a8ac979c219ba74d","observation_id":"465f1f82-0d91-4e23-b3d8-6971b039cd6b","resolution":{"observed_at":"2026-08-06T22:53:13.733065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.371132Z","title":"A convergence theory for deep learning via over-parameterization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.371132Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:80d927a5dd2bdc6555c0d731420043c2f36992fc67903ccb65bcd5490dbc6f23","observation_id":"e9e9cbf0-7da7-45a2-b44b-f4fd84b9c1dd","resolution":{"observed_at":"2026-08-06T22:53:06.371132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.702536Z","title":"Train big, then compress: Rethinking model size for efficient training and inference of transformers","venue":null,"work_id":"fbc6c141-0b02-4f73-8a19-85e9a513c31b","year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.436506Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:717b6ed2fd773b863d3857cc1e45924938fa18f92e63f5b124b0d74491f5dbdc","observation_id":"2b4ca624-61d4-46d4-987e-d5a9b27a407c","resolution":{"observed_at":"2026-08-06T22:53:13.707367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.489958Z","title":"Sparsegpt: Massive language models can be accurately pruned in one-shot","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.489958Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:65a204974e5877a511fc4c29d0eda95875db4b83242b38f1d4ba4ef0c01c59fa","observation_id":"64dfe37d-c439-45f1-a3f0-61f282a349f2","resolution":{"observed_at":"2026-08-06T22:53:06.489958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.03078","last_updated":"2023-06-05T17:53:28Z","snapshot_observed_at":"2026-08-07T09:56:21.569200Z","submitted_at":"2023-06-05T17:53:28Z","title":"SpQR: A Sparse-Quantized Representation for Near-Lossless LLM Weight Compression","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.03078","snapshot_observed_at":"2026-08-06T22:53:06.540313Z","title":"Spqr: A sparse-quantized representation for near-lossless llm weight compression.arXiv preprint arXiv:2306.03078, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.540313Z"},"links":{"cited_paper":"/paper/2306.03078","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:84dc0ecbf77d4320fa5eea15fec7bc2825be669fbf912e7d24d339ab899cc903","observation_id":"58fde576-b40e-4b83-816d-743a63056b15","resolution":{"observed_at":"2026-08-06T22:53:06.540313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-07T03:20:22.127593Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-06T22:53:06.589395Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning.arXiv preprint arXiv:2310.06694, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.589395Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:2a1c8b448b04287b9cbdfacba42a8de83501e01869dcd714087a0ecbe42882d4","observation_id":"b7d8c180-efd4-4507-a972-bcfb5d9685dc","resolution":{"observed_at":"2026-08-06T22:53:06.589395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02834","last_updated":"2024-06-23T08:45:33Z","snapshot_observed_at":"2026-07-06T17:25:18.238343Z","submitted_at":"2024-02-05T09:44:49Z","title":"Shortened LLaMA: Depth Pruning for Large Language Models with Comparison of Retraining Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02834","snapshot_observed_at":"2026-08-06T22:53:06.659060Z","title":"Shortened llama: A simple depth pruning for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.659060Z"},"links":{"cited_paper":"/paper/2402.02834","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:09a5de7bdbe690a249da0eba18aa0415c24e7a3917cd48f57da2455927e49a93","observation_id":"4b9b6483-a566-4a9e-a75d-3caf64efde62","resolution":{"observed_at":"2026-08-06T22:53:06.659060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.720235Z","title":"Llm-pruner: On the structural pruning of large language models.Advances in neural information processing systems, 36:21702–21720, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.720235Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:0d1c7f80d664e71438af4d621e700ed99bb96c93031c1e094cf29653537eb3d6","observation_id":"5603007a-58f6-48f9-bd4b-e4075362620d","resolution":{"observed_at":"2026-08-06T22:53:06.720235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10534","last_updated":"2023-06-05T19:16:25Z","snapshot_observed_at":"2026-07-06T14:33:08.041820Z","submitted_at":"2022-12-20T18:46:08Z","title":"DISCO: Distilling Counterfactuals with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10534","snapshot_observed_at":"2026-08-06T22:53:06.787151Z","title":"Disco: Distilling counterfactuals with large language models.arXiv preprint arXiv:2212.10534, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.787151Z"},"links":{"cited_paper":"/paper/2212.10534","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:5d525282e4ba36ae7593bd616d38e0707ccccc3e640e0b5d67929ca295b62568","observation_id":"e7eb27d7-51db-41fc-90f6-7031e5ebb259","resolution":{"observed_at":"2026-08-06T22:53:06.787151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02301","snapshot_observed_at":"2026-08-06T22:53:06.841926Z","title":"Distilling step-by-step! outperform- ing larger language models with less training data and smaller model sizes.arXiv preprint arXiv:2305.02301, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.841926Z"},"links":{"cited_paper":"/paper/2305.02301","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:90c83fdb5d7e988c3bb78b29c3aad4ebed45d976ed377a35325356ea486dab0d","observation_id":"c91728f5-ac8c-4a43-a2e8-abafee15971e","resolution":{"observed_at":"2026-08-06T22:53:06.841926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:06.917340Z","title":"Distilling reasoning capabilities into smaller language models.Findings of the Association for Computational Linguistics: ACL 2023, pages 7059–7073, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.917340Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:2a545d625b68f49a157ef982d6942cd01421727ae46544c752c15efbc1e6b319","observation_id":"bbfa6518-13c0-4810-82e1-5926c680b7f2","resolution":{"observed_at":"2026-08-06T22:53:06.917340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-06T22:53:06.984578Z","title":"Zephyr: Direct distillation of lm alignment.arXiv preprint arXiv:2310.16944, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:06.984578Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:468d2f3ec8efd73499eaf7bc42d61b034bdcd5d16ab6f8e0ed331d8529e3232b","observation_id":"f3186e47-474f-458f-9fb6-1a8c9124c0c3","resolution":{"observed_at":"2026-08-06T22:53:06.984578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.047017Z","title":"Zeroquant: Efficient and affordable post-training quantization for large-scale transformers","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.047017Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c31f40fff481b9afc9a36a7e72139688642dde79500f6fa9914315c01dca74e3","observation_id":"1636d911-4011-4e27-a4ab-2ebb3ade3241","resolution":{"observed_at":"2026-08-06T22:53:07.047017Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.111671Z","title":"A survey of quantization methods for efficient neural network inference","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.111671Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d96a613a677e4b21770629d20ee7ac1f83ed8e4a5cf626f38ef22e774cf36441","observation_id":"4a5cb47b-850f-43e1-852f-ed5a46bdbbaa","resolution":{"observed_at":"2026-08-06T22:53:07.111671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.174932Z","title":"Qlora: Efficient finetuning of quantized llms.Advances in neural information processing systems, 36:10088– 10115, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.174932Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:1db300a2f904c8cbe16ab1f976c1ac9f36ba10ed2cf6da095793af6b6dd45269","observation_id":"851377dd-f798-4706-8075-5456b74ead74","resolution":{"observed_at":"2026-08-06T22:53:07.174932Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.03853","last_updated":"2024-10-11T09:43:32Z","snapshot_observed_at":"2026-08-03T01:48:18.654934Z","submitted_at":"2024-03-06T17:04:18Z","title":"ShortGPT: Layers in Large Language Models are More Redundant Than You Expect","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.03853","snapshot_observed_at":"2026-08-06T22:53:07.225669Z","title":"Shortgpt: Layers in large language models are more redundant than you expect.arXiv preprint arXiv:2403.03853, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.225669Z"},"links":{"cited_paper":"/paper/2403.03853","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:8c753c1fea945aa77f789766c7ac44519addd593c6a4f7a307e6d73baef0d690","observation_id":"b29bd29c-62d9-41ac-b5aa-746d02b725a6","resolution":{"observed_at":"2026-08-06T22:53:07.225669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.279875Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.279875Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:5240d1f08183547ba1cbcd38f5812db0b0e23bb37e67ce13d64a3ca42f45c1cb","observation_id":"0bbeca5c-5abf-4875-9b0d-3b53db308ce8","resolution":{"observed_at":"2026-08-06T22:53:07.279875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.362157Z","title":"Smac3: A versatile bayesian optimization package for hyperparameter optimization.Journal of Machine Learning Research, 23(54):1–9, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.362157Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:bc3b619289a21c41e5ba8378d373601a82ae78ee0a8a9f68703219070d73ac3c","observation_id":"d3806a0b-ba7e-442d-b07b-44ae477e95be","resolution":{"observed_at":"2026-08-06T22:53:07.362157Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.15024","last_updated":"2024-02-09T17:59:40Z","snapshot_observed_at":"2026-07-06T17:21:01.918787Z","submitted_at":"2024-01-26T17:35:45Z","title":"SliceGPT: Compress Large Language Models by Deleting Rows and Columns","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.15024","snapshot_observed_at":"2026-08-06T22:53:07.452648Z","title":"Slicegpt: Compress large language models by deleting rows and columns","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.452648Z"},"links":{"cited_paper":"/paper/2401.15024","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e75f1c3d981fe40fad9e0be893cd424019412759455548a4fded90d9ac95741c","observation_id":"e41432c4-f54a-45ce-8390-146fef628779","resolution":{"observed_at":"2026-08-06T22:53:07.452648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.11187","last_updated":"2024-10-15T01:58:58Z","snapshot_observed_at":"2026-08-02T23:45:33.761426Z","submitted_at":"2024-02-17T04:16:30Z","title":"LaCo: Large Language Model Pruning via Layer Collapse","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.11187","snapshot_observed_at":"2026-08-06T22:53:07.541474Z","title":"Laco: Large language model pruning via layer collapse","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.541474Z"},"links":{"cited_paper":"/paper/2402.11187","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:740de6cd049a79c72600b40e9e8d2a68791dfd1a8737aefd635fc6b5192ba2bf","observation_id":"e8c327d2-7bde-4178-9385-5a7a644ab2e4","resolution":{"observed_at":"2026-08-06T22:53:07.541474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.02267","last_updated":"2024-08-25T14:41:32Z","snapshot_observed_at":"2026-07-06T18:09:29.876755Z","submitted_at":"2024-05-03T17:34:57Z","title":"Structural Pruning of Pre-trained Language Models via Neural Architecture Search","version":2},"cited_work":{"arxiv_id":"2405.02267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.02267","snapshot_observed_at":"2026-08-06T22:53:12.320965Z","title":"Structural Pruning of Pre-trained Language Models via Neural Architecture Search","venue":"cs.LG","work_id":"8db7176c-7d95-4a4a-b966-82b22430d6b3","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.601358Z"},"links":{"cited_paper":"/paper/2405.02267","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:a423234ca1be46cd26862017dabfe982154adcc875e34181c201d6da87394bcd","observation_id":"fe7ab95b-270e-4bc1-934d-b71894824905","resolution":{"observed_at":"2026-08-06T22:53:12.420176Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.608731Z","title":"Weight averaging for neural networks and local resampling schemes","venue":null,"work_id":"1dba09f4-2e39-4329-a435-f410ac64bb7a","year":1996},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.691794Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:67ce22e2d5820d13c088f7ceac762d2ae715b67d9ef2351d8f285a4e26b7f02d","observation_id":"9b9726de-5a39-47fe-80f2-41e55063db34","resolution":{"observed_at":"2026-08-06T22:53:13.613961Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-06T22:53:07.747444Z","title":"Editing models with task arithmetic.arXiv preprint arXiv:2212.04089, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.747444Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:9603a8c828f391b9edc35fed75c2eb0bced0ea58141a4cc69b33a507b6e80306","observation_id":"de267e04-2bf7-4f35-9047-e98cb7a11f50","resolution":{"observed_at":"2026-08-06T22:53:07.747444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.04468","last_updated":"2016-12-06T14:39:05Z","snapshot_observed_at":"2026-07-06T05:10:50.385049Z","submitted_at":"2016-09-14T22:42:23Z","title":"Sampling Generative Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.04468","snapshot_observed_at":"2026-08-06T22:53:07.816065Z","title":"Sampling generative networks.arXiv preprint arXiv:1609.04468, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.816065Z"},"links":{"cited_paper":"/paper/1609.04468","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:bb9c9184a70fb5af6536fb2a1343b0fb443f66085c98e18d5d3afcf6ca8899a7","observation_id":"e75639c1-4837-4121-be38-e00f2a802326","resolution":{"observed_at":"2026-08-06T22:53:07.816065Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.594368Z","title":"Ties-merging: Resolving interference when merging models.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":"9c1c5e1a-bc59-4a4e-8079-ea021c3d4107","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.880303Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:eed14a924a480a96dbc1f667c50a004681d4b6b3b5567634f5ba7cdef1e2cac9","observation_id":"7eff3e8c-0771-4c78-99fd-9d51ca32ccd2","resolution":{"observed_at":"2026-08-06T22:53:13.598729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:07.951088Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.951088Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e7bd297891e2cd3d2b56a96dfd4e63a22f7b7a9531f5cc87e07a6d47c334c215","observation_id":"7f274f58-6cbf-4fa8-8ecc-a274846f2511","resolution":{"observed_at":"2026-08-06T22:53:07.951088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13187","last_updated":"2025-01-27T10:19:44Z","snapshot_observed_at":"2026-07-06T17:47:22.458338Z","submitted_at":"2024-03-19T22:56:53Z","title":"Evolutionary Optimization of Model Merging Recipes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13187","snapshot_observed_at":"2026-08-06T22:53:07.973981Z","title":"Evolutionary optimization of model merging recipes.arXiv preprint arXiv:2403.13187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:07.973981Z"},"links":{"cited_paper":"/paper/2403.13187","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:d9a3679bacba50bf741f45ffe53cda1260d880de9fdff5a06f650076e19f86bf","observation_id":"46b3c6ab-3a85-48a5-9153-383a7a9fac6f","resolution":{"observed_at":"2026-08-06T22:53:07.973981Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04030","last_updated":"2025-06-25T14:44:30Z","snapshot_observed_at":"2026-08-06T08:28:44.387625Z","submitted_at":"2025-02-06T12:47:25Z","title":"Fine, I'll Merge It Myself: A Multi-Fidelity Framework for Automated Model Merging","version":2},"cited_work":{"arxiv_id":"2502.04030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04030","snapshot_observed_at":"2026-08-06T22:53:12.046539Z","title":"Fine, I'll Merge It Myself: A Multi-Fidelity Framework for Automated Model Merging","venue":"cs.AI","work_id":"26b29365-8f71-47ef-8198-43b3330c38b0","year":2025},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.045487Z"},"links":{"cited_paper":"/paper/2502.04030","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:742ae8ff4648ad57d7b464546d886f3008decc834cc1d2d3abda258e1eafecbe","observation_id":"c759d429-66ca-4db6-b7af-7938b9f8506d","resolution":{"observed_at":"2026-08-06T22:53:12.125172Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.569681Z","title":null,"venue":null,"work_id":"996c27e5-2897-4a63-a1c5-3fd2a348ea7a","year":2006},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.150248Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c88b96bea8f61d1bba94284412dd1b353ae150177c55b2487ef4871b3150dff1","observation_id":"36422beb-3a26-4377-89e0-fb0a14f494ce","resolution":{"observed_at":"2026-08-06T22:53:13.573887Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.278018Z","title":"Random forests.Machine learning, 45:5–32, 2001","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.278018Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:ff59d96b1e4bb59e211b33451ffd15eee89a9e80da9deae60868750f38e03500","observation_id":"367ce059-2646-424e-86c9-4fb00746a905","resolution":{"observed_at":"2026-08-06T22:53:08.278018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.437254Z","title":"Opencompass: A universal evaluation platform for foundation models.https://github.com/open-compass/opencompass, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.437254Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c5328bd581fada0785599438657c91565c14303dfe9cb576261e57e382dd00a4","observation_id":"fc2d9bc1-dd87-45d5-8bfe-9506f81140bc","resolution":{"observed_at":"2026-08-06T22:53:08.437254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05986","last_updated":"2020-11-05T14:46:45Z","snapshot_observed_at":"2026-07-06T09:11:58.924192Z","submitted_at":"2020-04-13T15:02:29Z","title":"CLUE: A Chinese Language Understanding Evaluation Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05986","snapshot_observed_at":"2026-08-06T22:53:08.643876Z","title":"Clue: A chinese language understanding evaluation benchmark.arXiv preprint arXiv:2004.05986, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.643876Z"},"links":{"cited_paper":"/paper/2004.05986","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c129ec014c2f58e65bf5829cfd4150e5e68d7170cb543fe449944b22ece0844a","observation_id":"41561ae4-bfd9-40af-8997-2a4f8ee0063d","resolution":{"observed_at":"2026-08-06T22:53:08.643876Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-06T22:53:08.839620Z","title":"Hellaswag: Can a machine really finish your sentence?arXiv preprint arXiv:1905.07830, 2019","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.839620Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:5225d780ba7663efea1c3d3d8fc1d859cae9348a2d91ed455d022f1c04c89b3b","observation_id":"b8c353eb-a716-44b6-9ae5-3061b89903fa","resolution":{"observed_at":"2026-08-06T22:53:08.839620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:08.961805Z","title":"Piqa: Reasoning about phys- ical commonsense in natural language","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:08.961805Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:7c96882ba82bd05f1544201f610e915f47f13d4448cc85824e38d0959636e99f","observation_id":"89821421-ff23-4b03-9d9c-8cf56a881d5a","resolution":{"observed_at":"2026-08-06T22:53:08.961805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.01265","last_updated":"2020-01-27T16:43:59Z","snapshot_observed_at":"2026-08-01T22:43:39.383637Z","submitted_at":"2019-06-04T08:29:00Z","title":"ChID: A Large-scale Chinese IDiom Dataset for Cloze Test","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.01265","snapshot_observed_at":"2026-08-06T22:53:09.095979Z","title":"Chid: A large-scale chinese idiom dataset for cloze test.arXiv preprint arXiv:1906.01265, 2019","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.095979Z"},"links":{"cited_paper":"/paper/1906.01265","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:3f0252ce26bfb01149b617b05028ec7e92e09095596265fa7d95022e10e07191","observation_id":"dcd3980f-7df1-4ec2-8e18-ed1924d02744","resolution":{"observed_at":"2026-08-06T22:53:09.095979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.524077Z","title":"The winograd schema challenge.KR, 2012:13th, 2012","venue":null,"work_id":"2867e391-6adb-4340-a632-21ce443c7caf","year":2012},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.259699Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:0476cdadd8a93361e8dc5ba6ad0060c7924394daef051f26d744204ea0cdbbc9","observation_id":"d5791ef2-0e0d-4452-b19c-1499f2a18da3","resolution":{"observed_at":"2026-08-06T22:53:13.528903Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.00937","last_updated":"2019-03-15T18:02:58Z","snapshot_observed_at":"2026-08-04T21:50:24.483867Z","submitted_at":"2018-11-02T15:34:29Z","title":"CommonsenseQA: A Question Answering Challenge Targeting Commonsense Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1811.00937","snapshot_observed_at":"2026-08-06T22:53:09.383657Z","title":"Commonsenseqa: A ques- tion answering challenge targeting commonsense knowledge.arXiv preprint arXiv:1811.00937, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.383657Z"},"links":{"cited_paper":"/paper/1811.00937","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:1721c8097959b3ccc6bf55a8afac918ca71ae8374a257904f8536d1dce57ae68","observation_id":"0c5259a8-1617-4684-b53a-553a0452852d","resolution":{"observed_at":"2026-08-06T22:53:09.383657Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.10044","last_updated":"2019-05-24T05:48:49Z","snapshot_observed_at":"2026-07-06T07:55:12.121264Z","submitted_at":"2019-05-24T05:48:49Z","title":"BoolQ: Exploring the Surprising Difficulty of Natural Yes/No Questions","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.10044","snapshot_observed_at":"2026-08-06T22:53:09.516180Z","title":"Boolq: Exploring the surprising difficulty of natural yes/no questions","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.516180Z"},"links":{"cited_paper":"/paper/1905.10044","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:5c2e383ed0e11cf9129e996c961b188e2a9543ad22674f528449108d83f90247","observation_id":"9c2952d2-bc22-4724-8dbb-74f4ffb336c2","resolution":{"observed_at":"2026-08-06T22:53:09.516180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-06T22:53:09.643480Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.643480Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:47181dc2fc1059a5e82314da34b3744a1f6041639ebc473e9cd8c55c789f5d5d","observation_id":"a31962f2-2d6f-460b-b022-ffcebfd272be","resolution":{"observed_at":"2026-08-06T22:53:09.643480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09212","last_updated":"2024-01-17T19:09:57Z","snapshot_observed_at":"2026-08-04T18:52:19.083847Z","submitted_at":"2023-06-15T15:49:51Z","title":"CMMLU: Measuring massive multitask language understanding in Chinese","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09212","snapshot_observed_at":"2026-08-06T22:53:09.736408Z","title":"Cmmlu: Measuring massive multitask language understanding in chinese","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.736408Z"},"links":{"cited_paper":"/paper/2306.09212","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:7121e81d52a892e821bbac43c4b10f652e35b845c483e9aab391eae6f6f56634","observation_id":"ced82713-2f5a-486b-8a20-f0183ebf6783","resolution":{"observed_at":"2026-08-06T22:53:09.736408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.04683","last_updated":"2017-12-05T19:36:03Z","snapshot_observed_at":"2026-08-07T10:40:47.462532Z","submitted_at":"2017-04-15T19:31:41Z","title":"RACE: Large-scale ReAding Comprehension Dataset From Examinations","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.04683","snapshot_observed_at":"2026-08-06T22:53:09.868001Z","title":"Race: Large-scale reading comprehension dataset from examinations.arXiv preprint arXiv:1704.04683, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.868001Z"},"links":{"cited_paper":"/paper/1704.04683","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:54b899899baac9de5980782060f31630b4ebfe4cc4c91cebce240a00bda9d683","observation_id":"99c88549-e03c-4d4e-8a29-6773c4eff872","resolution":{"observed_at":"2026-08-06T22:53:09.868001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1808.08745","last_updated":"2018-08-27T09:08:18Z","snapshot_observed_at":"2026-07-06T06:57:36.335954Z","submitted_at":"2018-08-27T09:08:18Z","title":"Don't Give Me the Details, Just the Summary! Topic-Aware Convolutional Neural Networks for Extreme Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.08745","snapshot_observed_at":"2026-08-06T22:53:09.981515Z","title":"Don’t give me the details, just the summary! topic-aware convolutional neural networks for extreme summarization.arXiv preprint arXiv:1808.08745, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:09.981515Z"},"links":{"cited_paper":"/paper/1808.08745","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:611677cf1fc5bdc2c33f5995272397fe8483b66437496f8c7d72cf01acba52ad","observation_id":"24ab2e58-1480-481f-948b-4651f1687d8b","resolution":{"observed_at":"2026-08-06T22:53:09.981515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.509048Z","title":"Investigating prior knowledge for challenging chinese machine reading comprehension.Transactions of the Association for Computational Linguistics, 8:141–155, 2020","venue":null,"work_id":"f5224d1c-873c-419a-9ed0-9f8abea9ae28","year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.098644Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:7cc975c978ee1e5c69683e972889eb559b6fce59348a189fc455072a52192f56","observation_id":"71684b67-6e7c-47a0-9a8d-41cb31aecb01","resolution":{"observed_at":"2026-08-06T22:53:13.513704Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-08-07T14:43:09.380195Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05653","snapshot_observed_at":"2026-08-06T22:53:10.226886Z","title":"Mammoth: Building math generalist models through hybrid instruction tuning.arXiv preprint arXiv:2309.05653, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.226886Z"},"links":{"cited_paper":"/paper/2309.05653","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:9d8ff9adcb631bba6f2827b820157255f11f878ea6fcb0350b78c77384817bd6","observation_id":"5200d681-ec6e-4d96-a754-64b6e76360b8","resolution":{"observed_at":"2026-08-06T22:53:10.226886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.493216Z","title":"llama-2-coder-7b (revision d30d193), 2023","venue":null,"work_id":"ae694a8f-ae54-4c09-b302-5949c73f8736","year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.334631Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e1386744fbcca55c9c40e4d23ef8e89cc051c18854bf307bcd41f12d67b590a5","observation_id":"60c85cda-9e71-493b-a449-e4337b1ba5e1","resolution":{"observed_at":"2026-08-06T22:53:13.497655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.12244","last_updated":"2025-05-27T06:49:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-24T16:31:06Z","title":"WizardLM: Empowering large pre-trained language models to follow complex instructions","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.12244","snapshot_observed_at":"2026-08-06T22:53:10.477326Z","title":"Wizardlm: Empowering large language models to follow complex instructions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.477326Z"},"links":{"cited_paper":"/paper/2304.12244","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e352bd48ed44580c740ca232f9aa3b1bae3976bc867f2200b8a7145017393655","observation_id":"b2753982-ae15-413d-b203-bdf956affde6","resolution":{"observed_at":"2026-08-06T22:53:10.477326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09583","last_updated":"2025-06-04T08:58:56Z","snapshot_observed_at":"2026-08-02T06:48:43.121988Z","submitted_at":"2023-08-18T14:23:21Z","title":"WizardMath: Empowering Mathematical Reasoning for Large Language Models via Reinforced Evol-Instruct","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09583","snapshot_observed_at":"2026-08-06T22:53:10.612011Z","title":"Wizardmath: Empowering mathematical rea- soning for large language models via reinforced evol-instruct.arXiv preprint arXiv:2308.09583, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.612011Z"},"links":{"cited_paper":"/paper/2308.09583","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:3fde1055318ff5b8d43a92f992e0cfa6c4731a54ecd98a4541e0b55f08d64d1d","observation_id":"79f1ecbd-8bb8-4e42-aa5b-bcc535a5fc56","resolution":{"observed_at":"2026-08-06T22:53:10.612011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:10.737231Z","title":"Code alpaca: An instruction-following llama model for code generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.737231Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:a16566f2c3d05337424bd7ad635d4b8ce4c728bc8ed2992ced333dd7819e0c58","observation_id":"ceee6883-52bb-4deb-af80-e4cdd7be8823","resolution":{"observed_at":"2026-08-06T22:53:10.737231Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.464018Z","title":"Shallow-deep networks: Understanding and mitigating network overthinking","venue":null,"work_id":"67151501-2232-4f36-b1ff-02a5b5eec3a9","year":2019},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:10.858211Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:6f6753acbfab678b05130e129d0259cdda68144ce36fff599f7ce828cbe8e10d","observation_id":"0ef822be-8ef7-41ba-b034-1612ba52e464","resolution":{"observed_at":"2026-08-06T22:53:13.471321Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17887","last_updated":"2025-03-03T17:02:05Z","snapshot_observed_at":"2026-08-03T06:33:46.668360Z","submitted_at":"2024-03-26T17:20:04Z","title":"The Unreasonable Ineffectiveness of the Deeper Layers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17887","snapshot_observed_at":"2026-08-06T22:53:11.013316Z","title":"The unreasonable ineffectiveness of the deeper layers.arXiv preprint arXiv:2403.17887, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.013316Z"},"links":{"cited_paper":"/paper/2403.17887","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c9356166d8e816e167646d08d54831ecb95c4126608ce7ba4ab89cad6c9151a1","observation_id":"b2b52689-eac5-4880-893e-9e4446e96386","resolution":{"observed_at":"2026-08-06T22:53:11.013316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:11.119687Z","title":"Pointer sentinel mixture models, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.119687Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:93af653950e6686728e68079fae1f5b0f7403c4cbdcbaf3664431351fbad646d","observation_id":"e0bfcfb1-4c52-4f1d-a23e-40942224123f","resolution":{"observed_at":"2026-08-06T22:53:11.119687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T22:53:11.283686Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.283686Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:3de0c5131f61924c98dde7603c1a965316609ab51c631848ea0c2c80b4d17ec3","observation_id":"6659eb75-c978-4863-bcaf-dd15fbd4173d","resolution":{"observed_at":"2026-08-06T22:53:11.283686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.193440Z","title":"Code-llama-3-8b, 2023","venue":null,"work_id":"7f8bd255-010d-406e-9164-2ecbbc8704cc","year":2023},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.435354Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:ae45b2332c41f67954b7f4094fa4606f7345a7457094025b23ef1c80bc0e677e","observation_id":"ea187a13-c493-40e8-9ca5-d437aaa93a22","resolution":{"observed_at":"2026-08-06T22:53:13.327788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:13.006477Z","title":"Mathcoder: Seamless code integration in LLMs for enhanced mathematical reasoning","venue":null,"work_id":"1d7b283b-49d5-4202-b25d-e89f2afaf3f6","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.514763Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:f9806e5cebfb486d9efbc24591feb142d3ae320b301154d295bef12de7c43aad","observation_id":"e6cf6ad8-219d-4136-bf6f-e3ee11477147","resolution":{"observed_at":"2026-08-06T22:53:13.125836Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T22:53:12.733503Z","title":"Mathcoder2: Better math reasoning from continued pretraining on model- translated mathematical code, 2024","venue":null,"work_id":"a7957c8d-11e9-4b10-a4dc-95520ea2657e","year":2024},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.602323Z"},"links":{"citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:c9e9873a3f090a510c996291e686eaf8feca00db25405a79661f7099855ab811","observation_id":"c01d04ee-2e52-4705-a017-140f7501f9e5","resolution":{"observed_at":"2026-08-06T22:53:12.875414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.05507","last_updated":"2019-11-13T14:36:01Z","snapshot_observed_at":"2026-07-06T08:36:43.643240Z","submitted_at":"2019-11-13T14:36:01Z","title":"Compressive Transformers for Long-Range Sequence Modelling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.05507","snapshot_observed_at":"2026-08-06T22:53:11.677172Z","title":"Goldilocks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-06T22:53:11.677172Z"},"links":{"cited_paper":"/paper/1911.05507","citing_paper":"/paper/2506.20480"},"observation_digest":"sha256:e4eac9ca707cbf69256900b4c220a917901e8049c24c20404da901fbbd5fe2d2","observation_id":"a6c4cd08-7636-42a4-a958-c515d864637b","resolution":{"observed_at":"2026-08-06T22:53:11.677172Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.20480","last_updated":"2025-06-25T14:24:59Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T22:44:52.442119Z","submitted_at":"2025-06-25T14:24:59Z","title":"GPTailor: Large Language Model Pruning Through Layer Cutting and Stitching"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2506.20480."}