{"as_of":"2026-08-11T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:28518b331be846c606740afb06eea111773362367e5c8e8a9a1536050e1b7798","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T11:47:24.980984Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-09T21:48:48.992712Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-11T14:26:03.981445Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"cited_work":{"arxiv_id":"2501.16650","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.16650","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Docs: Quantifying weight similarity for deeper insights into large language models","venue":null,"work_id":"6ba19fc6-801f-473c-9c31-965df31d91e4","year":2025},"citing_paper":{"arxiv_id":"2604.21905","last_updated":"2026-04-23T17:50:23Z","snapshot_observed_at":"2026-07-06T23:08:23.939574Z","submitted_at":"2026-04-23T17:50:23Z","title":"Low-Rank Adaptation Redux for Large Models","version":1},"reference_index":136,"source":"pdf_text","source_observed_at":"2026-05-09T21:48:48.992712Z"},"links":{"cited_paper":"/paper/2501.16650","citing_paper":"/paper/2604.21905"},"observation_digest":"sha256:09c8feb9ea42a5e0bc0abe18be39554f432780f2fc1c959503d8402c91abafc5","observation_id":"d68b3489-039f-49cc-b201-54ad94a0c68d","resolution":{"observed_at":"2026-05-11T14:26:03.983869Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.16650/citation-record","integrity":"/paper/2501.16650/integrity","json":"/paper/2501.16650/citation-record.json","paper":"/paper/2501.16650"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2201.00058","last_updated":"2022-06-28T22:35:25Z","snapshot_observed_at":"2026-08-01T15:47:09.133676Z","submitted_at":"2021-12-31T21:08:56Z","title":"Representation Topology Divergence: A Method for Comparing Neural Network Representations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.00058","snapshot_observed_at":"2026-08-10T11:47:24.789560Z","title":"Representation topol- ogy divergence: A method for comparing neural network representations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.789560Z"},"links":{"cited_paper":"/paper/2201.00058","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:a9c3caf5ab0510a9c417f8ff97987f0ba899e87ac04c5abe199656071c68d9df","observation_id":"05dc27ee-b118-424f-a936-014a0281c8c8","resolution":{"observed_at":"2026-08-10T11:47:24.789560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.810737Z","title":"Define: • X ∈ Rn×m as X = [e1, e2,","venue":null,"work_id":"55cc7eb9-3e81-4f82-8cb4-33b23931aad5","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.957502Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:c84637f034038d63f86f0a3c08e138ddabc34779532daea105e4a65b0a4a5fe9","observation_id":"16b0b76c-3dd6-466b-90f2-f884eb98425a","resolution":{"observed_at":"2026-08-10T11:47:25.815710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T11:47:24.809527Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.809527Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:791efd4df14fc7922e2231cbf182f20ba5839774518eb7f2ffc49abf75a715a5","observation_id":"af0f8470-2e8d-4d00-8085-ea81dd4b6b9f","resolution":{"observed_at":"2026-08-10T11:47:24.809527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-10T11:47:24.819179Z","title":"Training compute- optimal large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.819179Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:4eee1494c7559dd7f8c72dd29332a42276b27584d3cfc1900c2f1bf64ea7ee46","observation_id":"d5fb136d-9d71-40ac-bf3a-c11c482c1e98","resolution":{"observed_at":"2026-08-10T11:47:24.819179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.781589Z","title":null,"venue":null,"work_id":"f2f24ed0-f79c-4e1f-817d-9f813c48217f","year":1984},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.966835Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:d4fb49da431ae634fada3cd0751a1e6b937320bad8cb83aac6fe63c77adc7c98","observation_id":"0b8f7962-3c3a-42c1-bd10-c6a89c6361f1","resolution":{"observed_at":"2026-08-10T11:47:25.786022Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T11:47:24.828791Z","title":"Mixtral of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.828791Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:665b1203cb87045042c29c5d62a11b93f39ae75cfb20bc4d727423c9965c6d87","observation_id":"6f03a463-269e-4898-be0b-47fa11a3778d","resolution":{"observed_at":"2026-08-10T11:47:24.828791Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.825779Z","title":null,"venue":null,"work_id":"1cba7055-c94c-451d-a9ec-22bece382bf4","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.953178Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:00a5de1d6a0ef6630b5e27f7e7bc7d56aad7b2d9128c5f6dd3ed93207c7d99da","observation_id":"fe4e2a0f-733d-4ae0-b424-d832c1395dae","resolution":{"observed_at":"2026-08-10T11:47:25.830335Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06329","last_updated":"2025-04-09T12:54:43Z","snapshot_observed_at":"2026-08-09T05:07:05.480172Z","submitted_at":"2023-05-10T17:33:48Z","title":"Similarity of Neural Network Models: A Survey of Functional and Representational Measures","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06329","snapshot_observed_at":"2026-08-10T11:47:24.843051Z","title":"Towards measuring representational similarity of large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.843051Z"},"links":{"cited_paper":"/paper/2305.06329","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:cf73fd24104d4d6b62406fb14645cd9b4d4c6a22301f420d7cd094549639f8f9","observation_id":"2bd6e2b6-f581-4244-bbbd-fa3d2513e788","resolution":{"observed_at":"2026-08-10T11:47:24.843051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.16668","last_updated":"2020-06-30T10:42:02Z","snapshot_observed_at":"2026-08-07T09:27:36.420559Z","submitted_at":"2020-06-30T10:42:02Z","title":"GShard: Scaling Giant Models with Conditional Computation and Automatic Sharding","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.16668","snapshot_observed_at":"2026-08-10T11:47:24.852704Z","title":"Gshard: Scaling giant models with conditional computation and automatic sharding","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.852704Z"},"links":{"cited_paper":"/paper/2006.16668","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:42d65fbf7a84d9e7903bf360ff5276aeeaf42c947480dbb7d22368de28a8194c","observation_id":"dd5e5149-a33e-4bda-8c96-0951ce195283","resolution":{"observed_at":"2026-08-10T11:47:24.852704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12866","last_updated":"2024-07-13T07:23:07Z","snapshot_observed_at":"2026-08-03T17:10:50.739692Z","submitted_at":"2024-07-13T07:23:07Z","title":"Beyond KV Caching: Shared Attention for Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12866","snapshot_observed_at":"2026-08-10T11:47:24.862817Z","title":"Beyond kv caching: Shared attention for efficient llms","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.862817Z"},"links":{"cited_paper":"/paper/2407.12866","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:68ddc8175f934f2c45c8997a050cc7f2f44829e3cdb772a8fcb9697560880ddb","observation_id":"87eff07f-a74a-4e6e-afa0-0866962e880c","resolution":{"observed_at":"2026-08-10T11:47:24.862817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-10T11:47:24.871580Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.871580Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:777e4a125487062cf5232fc3693fd9f80941472f54124153a5fa206d024682ea","observation_id":"de712690-3514-4dd2-aa11-0747dd2bdc1b","resolution":{"observed_at":"2026-08-10T11:47:24.871580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09025","last_updated":"2024-12-13T02:44:34Z","snapshot_observed_at":"2026-08-09T22:29:10.262434Z","submitted_at":"2024-02-14T09:01:13Z","title":"SLEB: Streamlining LLMs through Redundancy Verification and Elimination of Transformer Blocks","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09025","snapshot_observed_at":"2026-08-10T11:47:24.885060Z","title":"Sleb: Streamlining llms through redundancy verification and elimination of transformer blocks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.885060Z"},"links":{"cited_paper":"/paper/2402.09025","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:71ea3d143c1fad54d64e50b6859bce0af6173e2627ddd05910162c2cb7d846d3","observation_id":"49953636-8b04-4da7-a906-40a9c50a41a3","resolution":{"observed_at":"2026-08-10T11:47:24.885060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11498","last_updated":"2020-03-25T17:04:10Z","snapshot_observed_at":"2026-08-06T03:58:35.410382Z","submitted_at":"2020-03-25T17:04:10Z","title":"Similarity of Neural Networks with Gradients","version":1},"cited_work":{"arxiv_id":"2003.11498","doi":null,"metadata_source":"pith","pith_arxiv_id":"2003.11498","snapshot_observed_at":"2026-08-10T11:47:25.134074Z","title":"Similarity of Neural Networks with Gradients","venue":"cs.LG","work_id":"af2a4a58-add6-45e9-85b0-d1ac3cb5de2b","year":2020},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.889596Z"},"links":{"cited_paper":"/paper/2003.11498","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:da08dc881d97d179202e8f3658eb77441e76a8ac4b7dbb5895542513d07c001d","observation_id":"742f666a-d0fa-43df-bfe7-96b0b3c99ad2","resolution":{"observed_at":"2026-08-10T11:47:25.139011Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00535","last_updated":"2024-03-15T02:03:21Z","snapshot_observed_at":"2026-08-09T02:19:14.359001Z","submitted_at":"2023-10-01T01:21:35Z","title":"JoMA: Demystifying Multilayer Transformers via JOint Dynamics of MLP and Attention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00535","snapshot_observed_at":"2026-08-10T11:47:24.894568Z","title":"Joma: Demystifying mul- tilayer transformers via joint dynamics of mlp and attention","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.894568Z"},"links":{"cited_paper":"/paper/2310.00535","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:796dfd41cdf3f04c13872bfde7874cbef5bfec6a869fa0fd90047b5169d4ffd3","observation_id":"d43e7ff9-9acc-41a8-9deb-dc256d17c6b5","resolution":{"observed_at":"2026-08-10T11:47:24.894568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T11:47:24.899313Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.899313Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:82abe2d7e250123d39004f8888e3c738c449a2de1502c230d550afce2d1f063f","observation_id":"e6288e51-2e02-473e-b75b-86b6f3a86d00","resolution":{"observed_at":"2026-08-10T11:47:24.899313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.01172","last_updated":"2020-05-03T19:48:15Z","snapshot_observed_at":"2026-08-11T08:21:14.020427Z","submitted_at":"2020-05-03T19:48:15Z","title":"Similarity Analysis of Contextual Word Representation Models","version":1},"cited_work":{"arxiv_id":"2005.01172","doi":null,"metadata_source":"pith","pith_arxiv_id":"2005.01172","snapshot_observed_at":"2026-08-10T11:47:25.079558Z","title":"Similarity Analysis of Contextual Word Representation Models","venue":"cs.CL","work_id":"31588c6c-ce21-49cb-997f-29e6edc626e7","year":2020},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.903806Z"},"links":{"cited_paper":"/paper/2005.01172","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:c3c2d651d7da33661052514c9845d17af65b33b92be213c9a49593c569ad0c31","observation_id":"6fba8e80-86cd-4fbb-8070-64940cbb7e2c","resolution":{"observed_at":"2026-08-10T11:47:25.086616Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.02414","last_updated":"2023-10-25T05:22:43Z","snapshot_observed_at":"2026-08-02T04:26:53.194797Z","submitted_at":"2022-10-05T17:34:44Z","title":"GLM-130B: An Open Bilingual Pre-trained Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.02414","snapshot_observed_at":"2026-08-10T11:47:24.908781Z","title":"Glm-130b: An open bilingual pre-trained model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.908781Z"},"links":{"cited_paper":"/paper/2210.02414","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:7bf30b0c3daa89c812242680d7f4366c9bddfa5874b9b29107b18ce85727232c","observation_id":"59f177f1-2a59-4317-9d92-c4ffb39e0fe2","resolution":{"observed_at":"2026-08-10T11:47:24.908781Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-10T11:47:24.913503Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.913503Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:738d4e0c3bd74e60fba756e3da53e755e9f7d9de99704f4543d8d6001c3c5e3b","observation_id":"f0d1d419-7a09-40d2-a230-f7be7e0e84a0","resolution":{"observed_at":"2026-08-10T11:47:24.913503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17568","last_updated":"2024-07-10T03:52:58Z","snapshot_observed_at":"2026-07-06T15:10:12.213443Z","submitted_at":"2023-03-30T17:34:01Z","title":"CodeGeeX: A Pre-Trained Model for Code Generation with Multilingual Benchmarking on HumanEval-X","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17568","snapshot_observed_at":"2026-08-10T11:47:24.918198Z","title":"Codegeex: A pre-trained model for code generation with multilingual evaluations on humaneval-x","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.918198Z"},"links":{"cited_paper":"/paper/2303.17568","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:5799e11891fe6f8417808f22615314777d54ed1df35c7feed5f7f8dd768fd427","observation_id":"4e66e345-a351-4244-8588-af7abb3a6c7e","resolution":{"observed_at":"2026-08-10T11:47:24.918198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.04260","last_updated":"2022-02-03T21:26:25Z","snapshot_observed_at":"2026-07-06T11:55:57.117755Z","submitted_at":"2021-10-08T17:15:47Z","title":"Taming Sparsely Activated Transformer with Stochastic Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.04260","snapshot_observed_at":"2026-08-10T11:47:24.923354Z","title":"Taming sparsely activated transformer with stochastic experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.923354Z"},"links":{"cited_paper":"/paper/2110.04260","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:d8510a5db1826305697aa3a8c49afe933bfe7052d418b757ee2ec28274067dc6","observation_id":"82837663-8add-443f-a6c0-3baf4e2fdac8","resolution":{"observed_at":"2026-08-10T11:47:24.923354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.898137Z","title":"Let X, Y∈ Rn×m and let PX , PY ∈ Rm×m be permutation matrices","venue":null,"work_id":"6f020869-c655-44b5-8980-dab65dac1e5b","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.929285Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:94fb51178591421ddcd17ddeb8bb32322704a017b35c71d26e92dce826373349","observation_id":"4a9ab880-d151-46f8-b573-141b76c9f3ac","resolution":{"observed_at":"2026-08-10T11:47:25.902803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.883408Z","title":"−0.6676 0 .5171 −0.5357 −0.7310 −0.5917 0 .3399 −0.1412 0 .6185 0 .7730 # , Y =","venue":null,"work_id":"ac72378a-b0a0-4e3f-909b-a20ecf020d99","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.934700Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:d6026ae70f48e8898970c721cf99b41c4a109b83b32dcde81aab6ae016fea204","observation_id":"909b7bc1-4c15-4b30-a5b1-f77afa32dbe9","resolution":{"observed_at":"2026-08-10T11:47:25.888325Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.869059Z","title":null,"venue":null,"work_id":"331c50b9-ab29-4616-8dcc-d50e6ab6b450","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.939478Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:fa23491c7ae4b934577c053273411256e0e0c0a445454d84a7a987d5993ec45c","observation_id":"0cd29245-4d5f-40a1-a919-0e4fa3d0ccf7","resolution":{"observed_at":"2026-08-10T11:47:25.873425Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.854771Z","title":"Meanwhile, TX and TY denote truncated identity matrices that retain the left singular vectors, ensuring that the accumulated variance meets a predefined limit","venue":null,"work_id":"0e4c0312-a1a6-4271-8bde-6e983f746a47","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.943871Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:4adc2f819e4d8d2845a7e4e3dfb9787eeb447bbd9089afd55225ad582b474c26","observation_id":"82a0312c-b81d-41ba-b9e4-2206007b2ecc","resolution":{"observed_at":"2026-08-10T11:47:25.859383Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.840236Z","title":"Meanwhile, TX and TY denote truncated identity matrices that retain the left singular vectors, ensuring that the accumulated variance meets a predefined limit","venue":null,"work_id":"6b734d3c-9783-49eb-8695-d53877582029","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.948575Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:e895be5c6f6f42a7469878c6799a10050fe2b29e08ca61872361b947f6e03acc","observation_id":"44cb9398-508f-492b-bc0d-891e6435ab4d","resolution":{"observed_at":"2026-08-10T11:47:25.844812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.795719Z","title":"∥X − Y ∥F = √ 2m = Ω(√n)","venue":null,"work_id":"59feda51-9175-46b6-8edc-d8fd7d062c95","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.962147Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:6b5f711b7d54bf08d3419b12618574e9687679552e9b1401a3b3a9d6cc827d2a","observation_id":"b61dc0a0-6574-43be-b91c-8f9d3dbf5ba2","resolution":{"observed_at":"2026-08-10T11:47:25.800069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.766816Z","title":"This formulation indicates that a larger Off-Diagonal Average Cosine Similarity value corresponds to a lower degree of orthogonality in the matrix","venue":null,"work_id":"ef94d9f6-6edc-4bd4-9555-93e59d971f88","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.971627Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:963e0192d173c9fdbf4286dbb5fa56659fc9f1dd52de5e8dd409fb4cd7faf52a","observation_id":"988ec9d1-67a7-463f-999f-558e392f1c38","resolution":{"observed_at":"2026-08-10T11:47:25.771907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.752498Z","title":"To quantify this, we define the similarity ratio as the ratio of the similarity scores between models (A) and (B) to those between models (A) and (C)","venue":null,"work_id":"44704ce2-5c96-4fa5-a03e-a9c2fd1825da","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.976246Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:cd3937acff4c9087051a226e2b419123c4fcbc094760f6e0ceead9d9fdfda414","observation_id":"32006ad6-cb52-4cc2-8ffb-0f74e8a5f83b","resolution":{"observed_at":"2026-08-10T11:47:25.757167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.737524Z","title":"Importance of the Maximization Function The maximization operation in the M AXCOSSIM function plays a crucial role in the DOCS algo- rithm","venue":null,"work_id":"5947c84b-7dfb-4900-9342-f8e8c5fe4416","year":2025},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.980984Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:6882e1ff8c0601bd56032bdcd05c3c9c35508c5f0cf30f604094f10a1204e354","observation_id":"633553c8-72a7-4ec2-bef5-ccbf2e0222bd","resolution":{"observed_at":"2026-08-10T11:47:25.742747Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-10T11:47:24.880626Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":1984,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.880626Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:a4f4c925e84efd046c3e3d6246a6a7b1814fce44253d18745a92115cf63e665f","observation_id":"386761bf-9eb5-4fbd-a5e8-921345391936","resolution":{"observed_at":"2026-08-10T11:47:24.880626Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1605.09096","last_updated":"2018-10-25T17:34:43Z","snapshot_observed_at":"2026-08-11T04:37:10.139619Z","submitted_at":"2016-05-30T03:54:18Z","title":"Diachronic Word Embeddings Reveal Statistical Laws of Semantic Change","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1605.09096","snapshot_observed_at":"2026-08-10T11:47:24.814636Z","title":"Diachronic word embeddings reveal statis- tical laws of semantic change","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2005,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.814636Z"},"links":{"cited_paper":"/paper/1605.09096","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:6bda840a680de7131e3fa12c95a29972e37f7a0fdf6c1e712799b409c28c80bd","observation_id":"fbfb80ff-3275-4797-99fa-f4c9b4098f7c","resolution":{"observed_at":"2026-08-10T11:47:24.814636Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.19384","last_updated":"2025-06-16T10:21:00Z","snapshot_observed_at":"2026-07-06T18:38:05.229292Z","submitted_at":"2024-06-27T17:57:03Z","title":"The Remarkable Robustness of LLMs: Stages of Inference?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.19384","snapshot_observed_at":"2026-08-10T11:47:24.848101Z","title":"The remarkable robustness of llms: Stages of infer- ence? arXiv preprint arXiv:2406.19384,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.848101Z"},"links":{"cited_paper":"/paper/2406.19384","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:b8fc22b4017b2e74f039e89da5680cd6434fee58bd8c2edaaa7ea4d808016741","observation_id":"6d714a17-3487-4d22-9899-f7490ef1e472","resolution":{"observed_at":"2026-08-10T11:47:24.848101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.08396","last_updated":"2022-04-18T16:48:19Z","snapshot_observed_at":"2026-08-06T11:48:25.823149Z","submitted_at":"2022-04-18T16:48:19Z","title":"StableMoE: Stable Routing Strategy for Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.08396","snapshot_observed_at":"2026-08-10T11:47:24.804883Z","title":"Stable- moe: Stable routing strategy for mixture of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.804883Z"},"links":{"cited_paper":"/paper/2204.08396","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:5fbc5bbc8f108d4445c86c23189923f8d1d0700967ef3a65d56db6a2848ed24f","observation_id":"d149ff03-2ff1-4033-bdc5-b3c1de397a85","resolution":{"observed_at":"2026-08-10T11:47:24.804883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.912512Z","title":"Contrasim–analyzing neural representations based on con- trastive learning","venue":null,"work_id":"0db1bde6-9eb9-4b8a-b108-979a35a5b611","year":2024},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.876404Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:72d9d8fb7afa29599497c08f9ed9e494652e90ba4c1f3aef2e77a4bd3c6dba47","observation_id":"9e1dd2c9-96f1-4a1e-a00d-833fa9c4a5a6","resolution":{"observed_at":"2026-08-10T11:47:25.917187Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:24.867353Z","title":"Cross-layer attention sharing for large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.867353Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:8630b0d62f52503ce581fd59eebb14b6be32f9f1b62250d126299c243650660e","observation_id":"b9d9a71b-ec28-4fee-b29c-c55482b03551","resolution":{"observed_at":"2026-08-10T11:47:24.867353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-11T08:20:29.798517Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-10T11:47:24.824244Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.824244Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:acb7559cbcffb9f0bf59b421968c4ff9343355ebeb5ca47d4f3ae7e4ea65439e","observation_id":"1dd28962-02a1-440f-a866-482422719b4d","resolution":{"observed_at":"2026-08-10T11:47:24.824244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.03852","last_updated":"2025-01-14T06:40:36Z","snapshot_observed_at":"2026-08-06T05:37:12.488102Z","submitted_at":"2023-09-07T17:07:36Z","title":"FLM-101B: An Open LLM and How to Train It with $100K Budget","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.03852","snapshot_observed_at":"2026-08-10T11:47:24.857799Z","title":"Flm-101b: An open llm and how to train it with 100 k budget","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.857799Z"},"links":{"cited_paper":"/paper/2309.03852","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:3ddfb4be0ef532c1b20330dc405a913f4b4652dc6065c50d87d3499ab2c6f841","observation_id":"b3c8182b-3ff7-4c20-929b-79fa92b1f6ad","resolution":{"observed_at":"2026-08-10T11:47:24.857799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.06745","last_updated":"2022-04-14T04:00:27Z","snapshot_observed_at":"2026-07-06T13:00:12.148951Z","submitted_at":"2022-04-14T04:00:27Z","title":"GPT-NeoX-20B: An Open-Source Autoregressive Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.06745","snapshot_observed_at":"2026-08-10T11:47:24.795182Z","title":"Gpt-neox-20b: An open-source autore- gressive language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.795182Z"},"links":{"cited_paper":"/paper/2204.06745","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:bdd6d8a9a871a80366a456355e302e112959f3a9728e3d96e9d1601c7b63be6b","observation_id":"0c82ae55-6a89-4f9e-a0d1-7af428c33d55","resolution":{"observed_at":"2026-08-10T11:47:24.795182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T11:47:25.927570Z","title":"Language models are few-shot learners","venue":null,"work_id":"5a3a8a17-61c3-4e63-ad02-397e086790d5","year":1901},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.799923Z"},"links":{"citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:c457771bece4cf945674c17a78a1b1fdd198cb468ed499bbd87b368aa111ec14","observation_id":"434f60a1-e965-4f14-9b1d-58d4a473bd9f","resolution":{"observed_at":"2026-08-10T11:47:25.932167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-10T11:47:24.837899Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.837899Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:77e01db8447364fda9097704c90d3671fb1c3aeafc04fcb5cdda31faaa2b46ea","observation_id":"d97dc3fe-4a23-4d6c-b2eb-37887b9e14ce","resolution":{"observed_at":"2026-08-10T11:47:24.837899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05500","last_updated":"2023-09-11T14:43:45Z","snapshot_observed_at":"2026-07-06T16:16:56.609388Z","submitted_at":"2023-09-11T14:43:45Z","title":"NeCo@ALQAC 2023: Legal Domain Knowledge Acquisition for Low-Resource Languages through Data Enrichment","version":1},"cited_work":{"arxiv_id":"2309.05500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05500","snapshot_observed_at":"2026-08-10T11:47:25.607368Z","title":"NeCo@ALQAC 2023: Legal Domain Knowledge Acquisition for Low-Resource Languages through Data Enrichment","venue":"cs.CL","work_id":"34c278a2-7db2-4953-9c19-4bfabae23531","year":2023},"citing_paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-10T11:47:24.833304Z"},"links":{"cited_paper":"/paper/2309.05500","citing_paper":"/paper/2501.16650"},"observation_digest":"sha256:a881904f5c44bcebafc5299f1b1abce923cf3dd7848fdbf4d41a05ca4b6795e5","observation_id":"8f909818-9c3f-43f9-8c4b-ef2b3b73bbe3","resolution":{"observed_at":"2026-08-10T11:47:25.612703Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2501.16650","last_updated":"2025-01-28T02:32:49Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:38:25.204754Z","submitted_at":"2025-01-28T02:32:49Z","title":"DOCS: Quantifying Weight Similarity for Deeper Insights into Large Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":27,"verified_exact":2,"verified_fuzzy":11},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2501.16650."}