{"as_of":"2026-08-07T20:22:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3dcc5b5a89d7aa484c25d45508d6f74dd1632b1fdd35fbf4bfe69a4348040f2d","coverage":[{"denominator":27,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":27,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T10:45:00.452935Z","state":"measured"},{"denominator":27,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":27,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.04567/citation-record","integrity":"/paper/2506.04567/integrity","json":"/paper/2506.04567/citation-record.json","paper":"/paper/2506.04567"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2408.12105","last_updated":"2025-02-08T13:03:20Z","snapshot_observed_at":"2026-07-06T19:04:22.495890Z","submitted_at":"2024-08-22T03:41:14Z","title":"Pareto Merging: Multi-Objective Optimization for Preference-Aware Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12105","snapshot_observed_at":"2026-08-07T10:45:00.119243Z","title":"Gong Cheng, Junwei Han, and Xiaoqiang Lu","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.119243Z"},"links":{"cited_paper":"/paper/2408.12105","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:eb8367c791398b6f4219f063d4ee28964513dff12fca44268b117fa53803802e","observation_id":"e77c0d03-f1d1-4f6e-a340-132e71f1fe63","resolution":{"observed_at":"2026-08-07T10:45:00.119243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02396","last_updated":"2024-10-03T11:17:58Z","snapshot_observed_at":"2026-07-06T19:26:54.335667Z","submitted_at":"2024-10-03T11:17:58Z","title":"Parameter Competition Balancing for Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02396","snapshot_observed_at":"2026-08-07T10:45:00.138368Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.138368Z"},"links":{"cited_paper":"/paper/2410.02396","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:c573ca3750ca5b0fb4a9da1af7dd0446987413159af2e6b8349e068c1a2875f8","observation_id":"78b2d079-2b3d-4971-aa97-9d6c98d59a30","resolution":{"observed_at":"2026-08-07T10:45:00.138368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.23733","last_updated":"2025-03-31T05:13:02Z","snapshot_observed_at":"2026-07-06T21:01:13.411586Z","submitted_at":"2025-03-31T05:13:02Z","title":"AdaMMS: Model Merging for Heterogeneous Multimodal Large Language Models with Unsupervised Coefficient Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.23733","snapshot_observed_at":"2026-08-07T10:45:00.152442Z","title":"Adamms: Model merging for heterogeneous multimodal large language models with unsupervised coefficient optimization.arXiv preprint arXiv:2503.23733,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.152442Z"},"links":{"cited_paper":"/paper/2503.23733","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:04243e026eeaef6ba65d16c608c0bce8ff369f55176de95d0fa10b2f419b59f9","observation_id":"dd8769fa-f58b-4251-a0f9-3953eb2e1eba","resolution":{"observed_at":"2026-08-07T10:45:00.152442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.190677Z","title":"Manning, Christopher Potts, and Róbert Csordás","venue":null,"work_id":"f31c5e98-21c9-4c53-823d-6a0a289d87d7","year":2025},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.331086Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:e2d672c3d560d3e1574d023ace307e98de97b4c47ff18ed81a0812e773e7e96f","observation_id":"5c64fb1c-8dfa-4403-b17c-428c9109ae55","resolution":{"observed_at":"2026-08-07T10:45:01.196344Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.02834","last_updated":"2021-06-05T08:22:05Z","snapshot_observed_at":"2026-07-06T11:16:13.546683Z","submitted_at":"2021-06-05T08:22:05Z","title":"MergeDistill: Merging Pre-trained Language Models using Distillation","version":1},"cited_work":{"arxiv_id":"2106.02834","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.02834","snapshot_observed_at":"2026-08-07T10:45:00.829981Z","title":"MergeDistill: Merging Pre-trained Language Models using Distillation","venue":"cs.CL","work_id":"d85541db-a7cf-4d43-9d23-da369e831c5f","year":2021},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.342419Z"},"links":{"cited_paper":"/paper/2106.02834","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:25c8e2a4e96c130ed7a933666fc1c107d0742f9cdc51a91950ddb1d2d9c62938","observation_id":"7452fd52-fbc0-4ba3-8964-c658931c70a2","resolution":{"observed_at":"2026-08-07T10:45:00.834977Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12837","last_updated":"2024-07-08T04:55:34Z","snapshot_observed_at":"2026-08-06T08:58:19.640985Z","submitted_at":"2024-06-18T17:55:15Z","title":"LayerMerge: Neural Network Depth Compression through Layer Pruning and Merging","version":3},"cited_work":{"arxiv_id":"2406.12837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.12837","snapshot_observed_at":"2026-08-07T10:45:00.806588Z","title":"LayerMerge: Neural Network Depth Compression through Layer Pruning and Merging","venue":"cs.LG","work_id":"44c7c781-0c56-452c-af74-5dcef4f58a41","year":2024},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.355468Z"},"links":{"cited_paper":"/paper/2406.12837","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:721418eb18579e4ae5b200282f8f7bfc45fd01bcc8de358716de919e792d8595","observation_id":"e45a3911-9a0b-451f-aa44-14e8838d26ea","resolution":{"observed_at":"2026-08-07T10:45:00.811767Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07529","last_updated":"2025-04-25T06:15:26Z","snapshot_observed_at":"2026-08-04T18:10:55.659617Z","submitted_at":"2024-06-11T17:55:25Z","title":"MAP: Low-compute Model Merging with Amortized Pareto Fronts via Quadratic Approximation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07529","snapshot_observed_at":"2026-08-07T10:45:00.391021Z","title":"Jingyun Liang, Jiezhang Cao, Guolei Sun, Kai Zhang, Luc Van Gool, and Radu Timofte","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.391021Z"},"links":{"cited_paper":"/paper/2406.07529","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:f0b1bc737f39a3dea739cb7141edc065294416f2722e5165b1b52d85b1e41160","observation_id":"b76bdcb1-ce35-4c53-b0a8-49897ab7a0b5","resolution":{"observed_at":"2026-08-07T10:45:00.391021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.16434","last_updated":"2025-05-22T09:18:51Z","snapshot_observed_at":"2026-08-07T14:58:51.822603Z","submitted_at":"2025-05-22T09:18:51Z","title":"Joint Flow And Feature Refinement Using Attention For Video Restoration","version":1},"cited_work":{"arxiv_id":"2505.16434","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.16434","snapshot_observed_at":"2026-08-07T10:45:00.716255Z","title":"Joint Flow And Feature Refinement Using Attention For Video Restoration","venue":"cs.CV","work_id":"de773121-4863-40c2-ad33-30692b3b8438","year":2025},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.403277Z"},"links":{"cited_paper":"/paper/2505.16434","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:2c079cbe664ba69508709548137e606b465c6733a940ed3d6a14daa737915e33","observation_id":"23738adc-91d9-4312-8744-7807ce2b9329","resolution":{"observed_at":"2026-08-07T10:45:00.721999Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.151119Z","title":"Reading digits in natural images with unsupervised feature learning","venue":null,"work_id":"af840b93-4b45-4b13-97dc-4e3c25f2d9f2","year":2011},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.409012Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:389cb4c99082e6fcb199af2b5ca24178fa0972c6f1b7dd33fbf8b80e778fdebf","observation_id":"9b6c7c5e-2dc3-4734-95d5-53248d4e92bd","resolution":{"observed_at":"2026-08-07T10:45:01.157543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1409.1556","last_updated":"2015-04-10T16:25:04Z","snapshot_observed_at":"2026-07-06T03:53:32.549552Z","submitted_at":"2014-09-04T19:48:04Z","title":"Very Deep Convolutional Networks for Large-Scale Image Recognition","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1409.1556","snapshot_observed_at":"2026-08-07T10:45:00.416156Z","title":"Very deep convolutional networks for large-scale image recognition","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.416156Z"},"links":{"cited_paper":"/paper/1409.1556","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:1a0b2a5cc83cf7d7470f8f685e28f29204af62eebf7f28c8c9646e4cc0bf6de3","observation_id":"c0801d17-1c09-4ce7-b28c-777ae14988b0","resolution":{"observed_at":"2026-08-07T10:45:00.416156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.10308","last_updated":"2024-04-16T06:34:08Z","snapshot_observed_at":"2026-08-06T16:19:55.629971Z","submitted_at":"2024-04-16T06:34:08Z","title":"Hierarchical Context Merging: Better Long Context Understanding for Pre-trained LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.10308","snapshot_observed_at":"2026-08-07T10:45:00.421845Z","title":"Hierarchical context merging: Better long context understanding for pre-trained llms.arXiv preprint arXiv:2404.10308,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.421845Z"},"links":{"cited_paper":"/paper/2404.10308","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:9974bb5ee5884780924988faa8d2dc23d263b5a2050fef211340718341f198da","observation_id":"20332a68-e70f-4301-8fcf-ffbdcca866bf","resolution":{"observed_at":"2026-08-07T10:45:00.421845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.128028Z","title":"The german traffic sign recognition benchmark: a multi-class classification competition","venue":null,"work_id":"520c9396-a8a4-49ad-8f47-dcd1e116d347","year":2011},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.426733Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:a04d99797c56a002fa3cc252184851ba9a90030de4cabf18351096aaaa3113b6","observation_id":"8162d655-b63b-4d4c-a234-5708517df30c","resolution":{"observed_at":"2026-08-07T10:45:01.136444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.06977","last_updated":"2025-05-14T14:11:52Z","snapshot_observed_at":"2026-08-07T15:48:06.585351Z","submitted_at":"2025-05-11T13:24:09Z","title":"CAT Merging: A Training-Free Approach for Resolving Conflicts in Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.06977","snapshot_observed_at":"2026-08-07T10:45:00.431361Z","title":"Cat merging: A training-free approach for resolving conflicts in model merging.arXiv preprint arXiv:2505.06977,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.431361Z"},"links":{"cited_paper":"/paper/2505.06977","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:aa7c8967c34f5151754e6cb56c633920e535af400e3353aa535ac941c89d4b29","observation_id":"a0385fe2-5c90-4fb4-80dd-9621bdab72a7","resolution":{"observed_at":"2026-08-07T10:45:00.431361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09522","last_updated":"2025-01-16T13:17:24Z","snapshot_observed_at":"2026-07-06T20:21:59.832347Z","submitted_at":"2025-01-16T13:17:24Z","title":"Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging","version":1},"cited_work":{"arxiv_id":"2501.09522","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.09522","snapshot_observed_at":"2026-08-07T10:45:00.582204Z","title":"Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging","venue":"cs.LG","work_id":"23afe1e0-7f13-450f-972b-cbcd30bf06e2","year":2025},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.437912Z"},"links":{"cited_paper":"/paper/2501.09522","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:8d3c679ac9db81d2d1de55af0388e83aae1421ac1e36ba1f251d00b1d2cf06a8","observation_id":"9278b738-4526-443f-8d77-e93b58bd9a96","resolution":{"observed_at":"2026-08-07T10:45:00.592794Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06072","last_updated":"2025-08-01T01:52:05Z","snapshot_observed_at":"2026-08-07T17:20:39.665338Z","submitted_at":"2025-03-08T05:41:42Z","title":"A Survey on Post-training of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06072","snapshot_observed_at":"2026-08-07T10:45:00.442702Z","title":"A survey on post-training of large language models.arXiv preprint arXiv:2503.06072,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.442702Z"},"links":{"cited_paper":"/paper/2503.06072","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:1dfefcaf712c93f7c977f9377193b282235a77be2fb341dbda03286fcfb03532","observation_id":"5ba99d04-4eaa-4223-bd5f-f6e1e04022ab","resolution":{"observed_at":"2026-08-07T10:45:00.442702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-07T10:45:00.452935Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities.arXiv preprint arXiv:2408.07666, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.452935Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:2b9add0d5162b847cb50e6e108bbb1ee39f5501b6c641696995de26aaa11dbf2","observation_id":"b5f24d57-a811-4d78-a4b9-18607d5d298c","resolution":{"observed_at":"2026-08-07T10:45:00.452935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14662","last_updated":"2025-04-20T15:57:12Z","snapshot_observed_at":"2026-08-07T16:00:45.608560Z","submitted_at":"2025-04-20T15:57:12Z","title":"Mitigating Parameter Interference in Model Merging via Sharpness-Aware Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14662","snapshot_observed_at":"2026-08-07T10:45:00.372787Z","title":"Mitigating parameter interference in model merging via sharpness-aware fine-tuning.arXiv preprint arXiv:2504.14662,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":1998,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.372787Z"},"links":{"cited_paper":"/paper/2504.14662","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:d07626e121726ad99ef4e7dd816275f662738ee467f00d9085d9c6c9270b273d","observation_id":"b4fd1448-f4a4-4a38-a43c-f468cee97cc2","resolution":{"observed_at":"2026-08-07T10:45:00.372787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.170444Z","title":"Alex Krizhevsky, Ilya Sutskever, and Geoffrey E Hinton","venue":null,"work_id":"eb5b9409-aeff-4b38-8157-09b0459dce33","year":2009},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.366605Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:b9cd296c51e2a802686e614d77443cd5a5442e7d91cdfec0264b343353d86db8","observation_id":"66689331-6a68-43f8-b64c-d2b7e745405d","resolution":{"observed_at":"2026-08-07T10:45:01.175928Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:00.360904Z","title":"doi: 10.1109/ICCVW.2013.77","venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.360904Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:72029372a180237364c6a317b9c8c6d603844f7a5c6360156b50d247372a914c","observation_id":"eb6d8915-423d-4c7a-a0bb-74ff7da0ff66","resolution":{"observed_at":"2026-08-07T10:45:00.360904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.207713Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"27b90f45-1987-4c19-9306-afdb8e1c773a","year":2020},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.199934Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:0ee46225f1f5d1e286eec2ac2a872978391333c560fa7a803f9ec4b5d0215094","observation_id":"e87122cc-0529-47fa-907b-685bac4f4945","resolution":{"observed_at":"2026-08-07T10:45:01.217317Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02575","last_updated":"2024-05-28T06:42:31Z","snapshot_observed_at":"2026-08-05T09:56:02.040968Z","submitted_at":"2023-10-04T04:26:33Z","title":"AdaMerging: Adaptive Model Merging for Multi-Task Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02575","snapshot_observed_at":"2026-08-07T10:45:00.447759Z","title":"Ties-merging: Resolving interference when merging models.Advances in Neural Information Processing Systems, 36:7093–7115, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.447759Z"},"links":{"cited_paper":"/paper/2310.02575","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:ee80a4ddb1e315f45e7f02f713534f583d52bc3e9c83e95776dcdf6dbb1b5307","observation_id":"ac057440-112e-428d-9b3b-b1930371db32","resolution":{"observed_at":"2026-08-07T10:45:00.447759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:01.240869Z","title":"Generative adversarial nets","venue":null,"work_id":"6cee7998-5bb6-4b71-b9ee-cd067a4be7e2","year":2014},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.168462Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:43837056cdfaf7e57fe7fe2b6ac826dd01545c8639e61c2591a1c61c03c2b826","observation_id":"440806a8-a740-440a-82ee-ef887bc4d064","resolution":{"observed_at":"2026-08-07T10:45:01.249189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-07T10:45:00.183061Z","title":"Distilling the knowledge in a neural network.arXiv preprint arXiv:1503.02531,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.183061Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:e12f266522d4d968edc7226fa51921cebcc5494749715d83db1b1f6879b63ec0","observation_id":"3a78bb67-d9d5-4f48-a795-051c245de6cb","resolution":{"observed_at":"2026-08-07T10:45:00.183061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.10436","last_updated":"2025-05-09T08:38:05Z","snapshot_observed_at":"2026-08-04T17:29:57.144968Z","submitted_at":"2025-02-09T14:24:16Z","title":"MERGE$^3$: Efficient Evolutionary Merging on Consumer-grade GPUs","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.10436","snapshot_observed_at":"2026-08-07T10:45:00.398386Z","title":"Merge3: Efficient evolutionary merging on consumer-grade gpus.arXiv preprint arXiv:2502.10436,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.398386Z"},"links":{"cited_paper":"/paper/2502.10436","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:bb631f5fd2f2c59e93dba070d319221065ac01a8c120c5f585f84885b0850ad1","observation_id":"b63a4cc0-6f27-437a-871c-9316abbfe70c","resolution":{"observed_at":"2026-08-07T10:45:00.398386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05407","last_updated":"2019-02-25T14:18:11Z","snapshot_observed_at":"2026-07-31T19:09:21.589864Z","submitted_at":"2018-03-14T17:09:27Z","title":"Averaging Weights Leads to Wider Optima and Better Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05407","snapshot_observed_at":"2026-08-07T10:45:00.215927Z","title":"Averaging weights leads to wider optima and better generalization.arXiv preprint arXiv:1803.05407,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.215927Z"},"links":{"cited_paper":"/paper/1803.05407","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:e08b88b8ec3112ac452a08a3406a8646ab40ad3be9e5ab90095492c3ad0c9c45","observation_id":"1f30a169-5cc3-4f13-ac4c-d67e9b4b823c","resolution":{"observed_at":"2026-08-07T10:45:00.215927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.13057","last_updated":"2023-08-24T19:50:25Z","snapshot_observed_at":"2026-08-04T16:34:04.652279Z","submitted_at":"2023-08-24T19:50:25Z","title":"Data-Side Efficiencies for Lightweight Convolutional Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.13057","snapshot_observed_at":"2026-08-07T10:45:00.080095Z","title":"Data-side efficiencies for lightweight convolutional neural networks.arXiv preprint arXiv:2308.13057,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.080095Z"},"links":{"cited_paper":"/paper/2308.13057","citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:199474bb4a5b3c85974f4dbc7b7c68a712ef2e3aa246fb7fb4557a557e243d5e","observation_id":"861e0bfb-63eb-435c-b0fc-527a670ac9ac","resolution":{"observed_at":"2026-08-07T10:45:00.080095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T10:45:00.099774Z","title":"I Chen, Hsu-Shen Liu, Wei-Fang Sun, Chen-Hao Chao, Yen-Chang Hsu, Chun-Yi Lee, et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T10:45:00.099774Z"},"links":{"citing_paper":"/paper/2506.04567"},"observation_digest":"sha256:af34dec02b72af1836530c175c96c864b9ba984989d52a45455d8441cd11bce9","observation_id":"daad28df-325a-4f98-8314-e2745557d2e4","resolution":{"observed_at":"2026-08-07T10:45:00.099774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.04567","last_updated":"2025-06-05T02:37:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:36:45.970790Z","submitted_at":"2025-06-05T02:37:10Z","title":"StatsMerging: Statistics-Guided Model Merging via Task-Specific Teacher Distillation"},"reference_resolution":{"displayed":27,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":17,"verified_exact":3,"verified_fuzzy":6},"total_outbound_references":27},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 27 of 27 outbound references and 0 inbound Pith citation observations for arXiv:2506.04567."}