{"as_of":"2026-08-08T11:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:58b3b9c8a4ab064a66abf76be59fc1dea1363be4a8358e4a09e167beb97d27a9","coverage":[{"denominator":83,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":83,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:42:25.419709Z","state":"measured"},{"denominator":87,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":87,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:43:52.414007Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-21T11:24:08.572672Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-08-06T14:43:52.414007Z","title":"Local mixtures of experts: Essentially free test-time training via model merging","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.18122","last_updated":"2025-07-24T06:17:39Z","snapshot_observed_at":"2026-08-06T14:36:16.245142Z","submitted_at":"2025-07-24T06:17:39Z","title":"Maximizing Prefix-Confidence at Test-Time Efficiently Improves Mathematical Reasoning","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-06T14:43:52.414007Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2507.18122"},"observation_digest":"sha256:267d8d530b1026a9d9336e3a7292fbd8dc033bf1148e89f49c7302fbc843466b","observation_id":"b2ec1165-c56b-4de8-86c4-693909690b61","resolution":{"observed_at":"2026-08-06T14:43:52.414007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2507.18809","last_updated":"2026-05-13T07:56:01Z","snapshot_observed_at":"2026-07-06T22:02:32.276277Z","submitted_at":"2025-07-24T21:11:39Z","title":"Test-time Offline Reinforcement Learning on Goal-related Experience","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-19T02:18:34.690441Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2507.18809"},"observation_digest":"sha256:b2c9bb91620aeb03538047a38557060f8931b1ba28faeb39368c24cbfaad13f7","observation_id":"0a3eaa3e-d678-4834-a968-72cee0f7f207","resolution":{"observed_at":"2026-05-19T02:21:59.692656Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2603.02945","last_updated":"2026-04-08T16:06:46Z","snapshot_observed_at":"2026-08-06T12:04:41.509217Z","submitted_at":"2026-03-03T12:53:04Z","title":"ACE-Merging: Data-Free Model Merging with Adaptive Covariance Estimation","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-15T16:58:36.575824Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2603.02945"},"observation_digest":"sha256:28a974b5bc7f22af2d9b3bb926b5d2c378808cd9f351b29e2a9367ccb4e70459","observation_id":"ac7f9dc3-5666-4c9c-970b-37406f13d5e7","resolution":{"observed_at":"2026-05-15T17:00:10.120979Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"cited_work":{"arxiv_id":"2505.14136","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.14136","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertolissi, J","venue":null,"work_id":"db0f5b76-4220-4028-84c4-b6f604d9ea2f","year":2025},"citing_paper":{"arxiv_id":"2605.20189","last_updated":"2026-03-23T07:18:02Z","snapshot_observed_at":"2026-08-01T19:18:00.278267Z","submitted_at":"2026-03-23T07:18:02Z","title":"SOLAR: A Self-Optimizing Open-Ended Autonomous Agent for Lifelong Learning and Continual Adaptation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-21T11:21:30.867480Z"},"links":{"cited_paper":"/paper/2505.14136","citing_paper":"/paper/2605.20189"},"observation_digest":"sha256:543f577c5693cf176f450e3675368d5d53a093edb7c7a59080ee50fbd837000a","observation_id":"d8beb062-cc2d-4c57-96b5-d2c1bfa2bf2e","resolution":{"observed_at":"2026-05-21T11:24:08.574065Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.14136/citation-record","integrity":"/paper/2505.14136/integrity","json":"/paper/2505.14136/citation-record.json","paper":"/paper/2505.14136"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.246421Z","title":"Git re-basin: Merging models modulo permutation symmetries","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.246421Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d8441093334bf5970fbbbd319a0f03a4e9423041e4e10c4d36198bfbf87cb171","observation_id":"50c9dd35-8559-43fd-a765-23f1301ad6f2","resolution":{"observed_at":"2026-08-07T15:42:17.246421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.310853Z","title":"The surprising effectiveness of test-time training for few-shot-learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.310853Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7cb8969b5bcbc4e9f286cf6b1abb33563eb6526b65786608380961b0b994c207","observation_id":"0afa14f2-6d19-4cda-be0a-d8b806d03f0c","resolution":{"observed_at":"2026-08-07T15:42:17.310853Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:17.456548Z","title":"Locally weighted learning","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.456548Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:8cf2b9c80c1e31641b4c06d3f2345b4f6fa1b70940a64b8ead9487b8c1aa27e2","observation_id":"ec076363-d9cb-4e52-b4e3-dc6d099facc7","resolution":{"observed_at":"2026-08-07T15:42:17.456548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.680062Z","title":"Active fine-tuning of multi-task policies","venue":null,"work_id":"ae277d76-6db4-45f0-b075-115e78f0aea0","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.556677Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:601998bead7e00124bd33dd4b746761be7b2af43f9923bf2fcf0fbbca704dd5f","observation_id":"345f48a3-5e76-4ad6-8d84-67a525d34949","resolution":{"observed_at":"2026-08-07T15:42:37.774529Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.434677Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":"8d856d14-a10b-43bc-aa00-51468f06e774","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.677799Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:8a07bdfac44a8fd35faa3dc84325a7070fa2fa83341e6cef5aa87edb6948e85a","observation_id":"60f4df47-51a7-41a4-89ac-692a1c23e792","resolution":{"observed_at":"2026-08-07T15:42:37.540777Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.275756Z","title":"Local learning algorithms","venue":null,"work_id":"da0ba176-aac5-435c-a299-1e716b8e0179","year":1992},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.755383Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:a066842025165788d612e75133f8f6e76aeb682d83de706a4d6f492c46857d43","observation_id":"8e79969c-6f29-4420-86cb-aa44ffb4019d","resolution":{"observed_at":"2026-08-07T15:42:37.366099Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-07T15:42:17.863956Z","title":"Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared Kaplan, Prafulla Dhariwal, Arvind Neelakantan, Pranav Shyam, Girish Sastry, Amanda Askell, et al","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.863956Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bf39b3ca699759064855fced320ac28409ac621510079344819be9b1246068b3","observation_id":"688f2454-ccf2-41e7-9e34-6e53f9ed9882","resolution":{"observed_at":"2026-08-07T15:42:17.863956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08755","last_updated":"2024-04-22T19:17:49Z","snapshot_observed_at":"2026-07-06T17:44:09.081164Z","submitted_at":"2024-03-13T17:53:47Z","title":"DAM: Dynamic Adapter Merging for Continual Video QA Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08755","snapshot_observed_at":"2026-08-07T15:42:17.967046Z","title":"Dam: Dynamic adapter merging for continual video qa learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:17.967046Z"},"links":{"cited_paper":"/paper/2403.08755","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fdf22257714ef6b51a17727f76f78b99417cfb05b0ca54a734da8dbbf2d9d2f0","observation_id":"5d8ffe5e-1075-4853-adee-58d21fefa0bc","resolution":{"observed_at":"2026-08-07T15:42:17.967046Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:37.102933Z","title":"Unified scaling laws for routed language models","venue":null,"work_id":"cbdcb0e6-ada1-4ddd-8265-c5b41890d7fc","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.080648Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2ce1763873362adecc9f86afea00c26fd2609b9248ac2b6579fb0c448b029f3a","observation_id":"44a6c1ea-a4d2-4c98-8933-6c94ba5857a4","resolution":{"observed_at":"2026-08-07T15:42:37.199967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.882586Z","title":"Robust locally weighted regression and smoothing scatterplots","venue":null,"work_id":"747174c6-cca6-4767-8193-49051edd5c8f","year":1979},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.164433Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:5337877b7f7c70616456a8b075ffbeab7fce4936c9e59d89b061a9024db19847","observation_id":"483a20bf-93cf-4200-9ef4-e29202e8640b","resolution":{"observed_at":"2026-08-07T15:42:36.975901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.651699Z","title":"Locally weighted regression: an approach to regression analysis by local fitting","venue":null,"work_id":"b140c35a-0e0d-4cdd-8e2d-8b2d9987b5b6","year":1988},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.311932Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:573c495ee0040d9ae9d15e301b6af29020a66e80375d269600a0a9de9c25f260","observation_id":"9417b1c5-3187-4c34-8acc-ae01b255b9af","resolution":{"observed_at":"2026-08-07T15:42:36.750851Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.480533Z","title":"Model merging by uncertainty-based gradient matching","venue":null,"work_id":"bf5b3720-e268-46db-a7a9-1f1b890a8458","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.401728Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:23aaeb5b5386bd0f53a834a0d8a28c31033819f02d7bc7560d55b3f6d89d50d5","observation_id":"0b1db69c-92f7-4711-bd59-c8a1f9032710","resolution":{"observed_at":"2026-08-07T15:42:36.546646Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-07T15:42:18.488521Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.488521Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:52b563872fe83ee1edff3408d0c72e5c42f064b78835f857a680a2fbe47a0c57","observation_id":"c690fa08-63e9-425e-8535-ae3539ae7763","resolution":{"observed_at":"2026-08-07T15:42:18.488521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05298","last_updated":"2025-04-07T17:56:31Z","snapshot_observed_at":"2026-08-07T16:07:51.376018Z","submitted_at":"2025-04-07T17:56:31Z","title":"One-Minute Video Generation with Test-Time Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05298","snapshot_observed_at":"2026-08-07T15:42:18.611106Z","title":"One-minute video generation with test-time training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.611106Z"},"links":{"cited_paper":"/paper/2504.05298","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:90cf60c1bf294bde66e35e8c5f67382a4c7a3b7f74a8d87b484d9bdfb6b8fd86","observation_id":"3c14d67b-c186-4474-a289-0dbcca338076","resolution":{"observed_at":"2026-08-07T15:42:18.611106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:36.209009Z","title":"Ensemble methods in machine learning","venue":null,"work_id":"541a9cb4-d837-49ab-85c3-bdb28154eab2","year":2000},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.725297Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:007329d786d43213a5eb8ce25114cfb32de2d07347df08875d71aa8487cf7a8f","observation_id":"6cdbec9b-fee1-4bcc-866b-f52df688ae82","resolution":{"observed_at":"2026-08-07T15:42:36.340165Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.965750Z","title":"Test-time training with masked autoencoders","venue":null,"work_id":"c845e78e-223d-4d62-a46e-24da754ec1ed","year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.808003Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2a9c98ad6bb2037bbf99b8c6cd02e9e4d34eb6acf9b0e84820117e4195d4112c","observation_id":"894aa328-5123-4dda-a541-a4320cd983f2","resolution":{"observed_at":"2026-08-07T15:42:36.072414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.713544Z","title":"Loss surfaces, mode connectivity, and fast ensembling of dnns","venue":null,"work_id":"d779ce86-b1e4-4457-813c-dc929f5fcb47","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:18.955075Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4ab2c6bb5c89d2080510200737886c21b5d9ad44aece8660a39d3a61c612dfa7","observation_id":"b6d68517-0b9b-4287-9774-455ddacbf745","resolution":{"observed_at":"2026-08-07T15:42:35.865538Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T15:42:19.084909Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.084909Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:82c7c845e8339ee4815650d87790cd73c56c4b02756ee5a4c4fcb399f397ff00","observation_id":"b09027ed-38c5-4c40-a951-96d0bc23b0d3","resolution":{"observed_at":"2026-08-07T15:42:19.084909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-07T15:42:19.207296Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.207296Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2d454c1e8d8ccec0a8592f0537907dc7818504439c67eb9c6df1339090cb06ae","observation_id":"0366fb06-50ce-4186-9a52-3582be47e2a4","resolution":{"observed_at":"2026-08-07T15:42:19.207296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.14177","last_updated":"2023-03-24T17:38:58Z","snapshot_observed_at":"2026-08-01T15:00:39.464566Z","submitted_at":"2023-03-24T17:38:58Z","title":"Scaling Expert Language Models with Unsupervised Domain Discovery","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.14177","snapshot_observed_at":"2026-08-07T15:42:19.320715Z","title":"Scaling expert language models with unsupervised domain discovery","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.320715Z"},"links":{"cited_paper":"/paper/2303.14177","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:1ad911091e9b02a5e4f1a12d64efbcf68a31ac1479d4c9a0ea625b838cb78a78","observation_id":"b700499a-34f2-4a2c-ac60-b4c67ed46b52","resolution":{"observed_at":"2026-08-07T15:42:19.320715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.486151Z","title":"Retrieval augmented language model pre-training","venue":null,"work_id":"4a0f9092-d70b-4186-832e-e82f932fe9fc","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.419162Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:9dd8570c78af15e96c65f8c434aa56c7b60f65e79874db17ae671fbcbcddeadd","observation_id":"6c76160d-314f-42c2-8740-83ce8aaec0d9","resolution":{"observed_at":"2026-08-07T15:42:35.595720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.244928Z","title":"Test-time training on nearest neighbors for large language models","venue":null,"work_id":"dfaadc89-1a71-49e9-b405-98dee4420761","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.545328Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:cbb64d68613cfe62195df91588859af1f619aadc3d940fb0985b72198e9c20a3","observation_id":"5e0acaeb-7170-4ee4-bf16-6b65c82fa891","resolution":{"observed_at":"2026-08-07T15:42:35.368500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:19.657209Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.657209Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0edea822b9b27c908069f427cc634436cf7ef91df054110f942eefa0b9cf6aab","observation_id":"3403c4c1-1f84-4793-99b5-27938cbd7adf","resolution":{"observed_at":"2026-08-07T15:42:19.657209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:19.778274Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.778274Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:00155b12534f1bd982eb3cf28d0616aa7f9db523b37b7af43359c576343f535a","observation_id":"d46d9d77-0fd0-4e4b-929b-c56649afbb54","resolution":{"observed_at":"2026-08-07T15:42:19.778274Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:35.002324Z","title":"Transductive active learning: Theory and applications","venue":null,"work_id":"49570d1a-ae05-41a4-8c8b-cb9c67d5242b","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.881368Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d5c51c9b8280222c203c20c3403ceef3995f4b8361f834ed048d8e5966d572a0","observation_id":"45241f8a-5b7b-4ef4-b3b1-5fbdbacec3a8","resolution":{"observed_at":"2026-08-07T15:42:35.114607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.857358Z","title":"Efficiently learning at test-time: Active fine-tuning of llms","venue":null,"work_id":"8ff9f4b2-ec35-4cbc-abe1-7873cfd6f7a7","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:19.982053Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:67ad63fee24cb70496e29be1a033e82078fd97d5420621760f02494dbb8221e4","observation_id":"0c564aba-5a74-4273-b9cd-5c6f695e9d14","resolution":{"observed_at":"2026-08-07T15:42:34.926933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.708087Z","title":"Editing models with task arithmetic","venue":null,"work_id":"a13d3f7a-d890-4562-9f6d-44932c315939","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.214130Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c9b5e1b84cb983c548f4cd8e635867d9485642e12b9eda1d0854a534ce0375cf","observation_id":"6f7ca5ab-1e17-4361-8dee-193cb466653d","resolution":{"observed_at":"2026-08-07T15:42:34.773176Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.482035Z","title":"Averaging weights leads to wider optima and better generalization","venue":null,"work_id":"4c8bec5b-ba9d-4e44-a9b0-3a7494518e29","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.306518Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:e8c48b10bf97fc2971a18bcb1f56bf4ebee4671e3031e65498d0025f409ac02c","observation_id":"9c6a4e22-1c80-4049-b499-04669cfdd062","resolution":{"observed_at":"2026-08-07T15:42:34.599954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.286837Z","title":"Data clustering: 50 years beyond k-means","venue":null,"work_id":"3f529c46-ca49-408c-a7b9-ead7348f4c2a","year":2010},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.514328Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:f41cad131f42f999eb9ec21b2914d1f69987c62874f89e3ab462a2d581a23d6c","observation_id":"a647910f-62ea-485d-adc6-3380a52256a3","resolution":{"observed_at":"2026-08-07T15:42:34.376808Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:34.127794Z","title":"Online domain adaptation of a pre-trained cascade of classifiers","venue":null,"work_id":"3448cf25-e53a-49a6-81f8-e6bdd38e7686","year":2011},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.599411Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:15b12084d78ef0116851465ed692517fc04cdb01fce643328fe26f87815a1fcb","observation_id":"ce90a2cb-2155-48bf-82ff-2cc9dbe9d09b","resolution":{"observed_at":"2026-08-07T15:42:34.206858Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.942812Z","title":"Llm-blender: Ensembling large language models with pairwise ranking and generative fusion","venue":null,"work_id":"a3f068e2-807c-41da-bc28-8ac86288489c","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.701258Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d8291971cac018161d90243cfee697874827f8ea10376a7227abbc406cc88608","observation_id":"7224f32c-663a-4394-88e0-45346641c877","resolution":{"observed_at":"2026-08-07T15:42:34.038607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.778166Z","title":"Dataless knowledge fusion by merging weights of language models","venue":null,"work_id":"cabe209e-4ed1-4663-ab26-e66c1cfc5a61","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.789395Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:17362a0e8b1a62badf2f2dd6b382f1b92c80dd35e448b3332479e4c466bb27d6","observation_id":"efa7732b-6d4a-477f-86fc-a3d06da64fd3","resolution":{"observed_at":"2026-08-07T15:42:33.853625Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19098","last_updated":"2026-05-22T15:30:44Z","snapshot_observed_at":"2026-08-07T23:04:10.083357Z","submitted_at":"2024-12-26T07:42:06Z","title":"SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation","version":4},"cited_work":{"arxiv_id":"2412.19098","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.19098","snapshot_observed_at":"2026-08-07T15:42:25.988601Z","title":"SyMerge: From Non-Interference to Synergistic Merging via Single-Layer Adaptation","venue":"cs.LG","work_id":"b00a9daa-b797-4532-a5ec-878803052562","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.895955Z"},"links":{"cited_paper":"/paper/2412.19098","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:81178dbbe011111f6e056b9a71ef71d100e8e98d0d699760f9164349627ad3f7","observation_id":"bbf018a9-c097-4be0-9c40-6836b3cc0816","resolution":{"observed_at":"2026-08-07T15:42:26.033203Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.597996Z","title":"Generalization through memorization: Nearest neighbor language models","venue":null,"work_id":"584e7544-0f1c-4dea-8b18-50f05d49752e","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:20.985893Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:8a213253f76b48c6e409f113f6c426353a3673c09b17817963245ff78a9f130c","observation_id":"67cedf8f-cfe0-4e81-b7a1-a8cc98a7ce46","resolution":{"observed_at":"2026-08-07T15:42:33.684198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.396620Z","title":"Dynamic evaluation of neural sequence models","venue":null,"work_id":"959dd573-2473-49df-a4d2-b165a3401255","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.068964Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:dceb3eba4962f61a6b3f79ba2166889cd0a30ac49fdbdc90197dcbff332413a7","observation_id":"6f1bf15d-9dfb-48d3-a371-b59a6c68310a","resolution":{"observed_at":"2026-08-07T15:42:33.485743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.08378","last_updated":"2019-04-17T17:26:01Z","snapshot_observed_at":"2026-08-05T20:05:19.093291Z","submitted_at":"2019-04-17T17:26:01Z","title":"Dynamic Evaluation of Transformer Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.08378","snapshot_observed_at":"2026-08-07T15:42:21.167110Z","title":"Dynamic evaluation of transformer language models","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.167110Z"},"links":{"cited_paper":"/paper/1904.08378","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:e40932b83943296e7a9e32535ce9b6d8d579c52ffde32b741cdb23a486dee476","observation_id":"200186a7-a4ba-4468-a194-526ef02e0711","resolution":{"observed_at":"2026-08-07T15:42:21.167110Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.04411","last_updated":"2026-07-20T03:20:46Z","snapshot_observed_at":"2026-07-23T23:19:59.155018Z","submitted_at":"2025-02-06T11:26:30Z","title":"Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing","version":3},"cited_work":{"arxiv_id":"2502.04411","doi":null,"metadata_source":"pith","pith_arxiv_id":"2502.04411","snapshot_observed_at":"2026-08-07T15:42:25.856629Z","title":"Mediator: Memory-efficient LLM Merging with Less Parameter Conflicts and Uncertainty Based Routing","venue":"cs.LG","work_id":"3c6af1aa-b4fb-4d6d-a896-75ac891d4fd5","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.281499Z"},"links":{"cited_paper":"/paper/2502.04411","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:e7dc21164d002fa9d5f4711fd35b22a2d7053518ea9a24a1bd7a9ba823cd8186","observation_id":"1c92c14e-10c5-49a3-bdaf-8a6e5ac0f3ab","resolution":{"observed_at":"2026-08-07T15:42:25.897996Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.228962Z","title":"u ttler, Mike Lewis, Wen-tau Yih, Tim Rockt \\","venue":null,"work_id":"349a910c-1182-4222-8adc-32da79898357","year":2019},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.412505Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0559e83db8c66619433d58cf9a3249479e37ba718695e45e3c78a0c5b07689e9","observation_id":"f679da36-a06e-4377-b785-798b607e6162","resolution":{"observed_at":"2026-08-07T15:42:33.312813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T15:42:21.516966Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.516966Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:3e2ad8aee09faff49d0e881ccf5c54e6f8bd34fbc3701b10f2088a5138142c61","observation_id":"7b058177-784b-435a-a3ff-7acf76772da6","resolution":{"observed_at":"2026-08-07T15:42:21.516966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:33.062127Z","title":"Dexperts: Decoding-time controlled text generation with experts and anti-experts","venue":null,"work_id":"270fb671-3508-4d6b-93c7-f0eac921f3c6","year":2021},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.630172Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:aca235bada9701fd402183353c28ee4cb121d1acec02a7b1acc8d3ea3876c7ae","observation_id":"4f00b3f1-55ff-4655-bdb2-be73a8482d96","resolution":{"observed_at":"2026-08-07T15:42:33.133666Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.892178Z","title":"Multivariable functional interpolation and adaptive networks","venue":null,"work_id":"9f426f1d-be8f-45f7-ba22-5d17231338e7","year":1988},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.747338Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:563b63db5ed0e9cf23afb7824d12cdbf9cf2e79bc89927256525a3c2fc2a5f75","observation_id":"44720ceb-7c44-4c5e-828e-da27d467246a","resolution":{"observed_at":"2026-08-07T15:42:32.984327Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.741938Z","title":"Twin-merging: Dynamic integration of modular expertise in model merging","venue":null,"work_id":"46e883fa-755b-4ecd-acdd-eb7dfecae170","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.824509Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:81384fb314ec22cde512fd0cafa18d54bc41f943be20cbdcbac9368279edc441","observation_id":"61f9c57b-1992-4462-89ad-7e254663a618","resolution":{"observed_at":"2026-08-07T15:42:32.812385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.517722Z","title":"Merging models with fisher-weighted averaging","venue":null,"work_id":"f39378d7-3f24-4f8c-8417-80a7043279bc","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.902766Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:f4783bed10eb06a2d1ad08aec396a8b706bea0dc8dfb0505d29e4b9517f7ee1b","observation_id":"aa047537-5670-4847-a76c-e6796bae7f0d","resolution":{"observed_at":"2026-08-07T15:42:32.659125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:32.251559Z","title":"Pack of llms: Model fusion at test-time via perplexity optimization","venue":null,"work_id":"21161dae-fc62-4b1d-8e81-d8a9c82efe93","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.963114Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ba0579d3af6b8e5fcc26a7bbef7848e8af52b0adb82a355619eca48c281487d2","observation_id":"0c60b6b0-0436-4e20-a6aa-a3c936fe74e8","resolution":{"observed_at":"2026-08-07T15:42:32.401434Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.871346Z","title":"Fast learning in networks of locally-tuned processing units","venue":null,"work_id":"ccf7ce7f-af95-4c22-a9a0-5298eaa17bef","year":1989},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.042426Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fd3897a3dfeb2dce318f35ae01d9bab6aef5ddaa46ea4f493f80fe3ebcbb091f","observation_id":"78603686-6705-43da-bbb9-d6ad620f54d5","resolution":{"observed_at":"2026-08-07T15:42:32.063336Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.481754Z","title":"On estimating regression","venue":null,"work_id":"24426426-314a-4367-ab47-a661e87ce22f","year":1964},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.166824Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4ff585fa3a01f35c5168731d3975c9063dddb0352afe08b3351ee4ab894045ee","observation_id":"4d3067e0-6e61-495d-9aa5-fea18cb004b0","resolution":{"observed_at":"2026-08-07T15:42:31.629098Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:31.191896Z","title":"Dawin: Training-free dynamic weight interpolation for robust adaptation","venue":null,"work_id":"427706aa-82bf-4e60-a2dc-eb1b581e03ad","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.245145Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:ee032c6a99b6338ab7aeeaeba31d1765aad441d8bcb714eb9afcc03b6cf6187f","observation_id":"f9ca9869-a205-42c4-9428-b0eecfeebcdd","resolution":{"observed_at":"2026-08-07T15:42:31.289886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.996588Z","title":"On estimation of a probability density function and mode","venue":null,"work_id":"c6ac9a92-27c1-475e-b70d-a69d19c1c1e5","year":1962},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.317921Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2cc3e162707058b958aafd43586a32464dc1cd8473d399ef37100e658d792d01","observation_id":"8fff8a72-3484-4727-94c2-9c2f1244d29f","resolution":{"observed_at":"2026-08-07T15:42:31.079364Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-07T15:42:22.417681Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.417681Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:b8d8f6e40d518980e3d249c55400556813aa6defed331a8a8846b5d85c1454ea","observation_id":"733b3e81-8f4d-43fd-b2ba-ba7a8eb33670","resolution":{"observed_at":"2026-08-07T15:42:22.417681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:22.509217Z","title":"Mingle: Mixtures of null-space gated low-rank experts for test-time continual model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.509217Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:75fd16766871e1cfb4bebcb14c31d274f7509c3cdba5d5499a6f0b254382f5e6","observation_id":"a392aea4-7edc-4ab1-a210-2eebc33457ae","resolution":{"observed_at":"2026-08-07T15:42:22.509217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.580074Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":"6f2274e5-8740-40b6-ba58-9ccd3c9e473d","year":2019},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.583606Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4a1baa096768aecab2c9d0c17846a914a3fe3ee3e82a9ba935e1c3549f0aa0b9","observation_id":"baa14e24-7dd0-4c58-93b4-1abe85b19cc3","resolution":{"observed_at":"2026-08-07T15:42:30.761505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:30.248644Z","title":"Remarks on Some Nonparametric Estimates of a Density Function","venue":null,"work_id":"6949125d-854d-4b0f-ade3-54a00478a444","year":1956},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.657787Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:53d08e97c94682dba8b835391ca8e191384520a03167c63b7c5aaf5918cc248e","observation_id":"fc9962c5-04c2-4d4f-b506-c9f2d499b581","resolution":{"observed_at":"2026-08-07T15:42:30.404692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:22.738268Z","title":"Dreambooth: Fine tuning text-to-image diffusion models for subject-driven generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.738268Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:45c1b3c40368c8fe39bf3db20e7275b079f36cc7459100eb666930e6b85cc80c","observation_id":"88a80c22-1f81-44db-a666-cc27371b6d47","resolution":{"observed_at":"2026-08-07T15:42:22.738268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.993110Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer","venue":null,"work_id":"1b1c1c62-ab16-4d4d-a51c-57f600f79018","year":2017},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.826317Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:215a66ae7626a77aed021971a0cce04cc165ee47699a6de701392fed996a7608","observation_id":"b92bbd08-3c22-4ae7-a312-9ec539f64ffd","resolution":{"observed_at":"2026-08-07T15:42:30.145939Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.751113Z","title":"zero-shot","venue":null,"work_id":"65ea57aa-93fd-426f-aa6d-bae1afb6c5ab","year":2018},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:22.923014Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c3cd4e3f7aa9bd7e3a01a439e4ba3efd1d8ad8eb0e37265540949bbe536588d7","observation_id":"0e12106d-8fa4-4938-b008-9ac07166fd39","resolution":{"observed_at":"2026-08-07T15:42:29.873608Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.00735","last_updated":"2025-03-05T11:50:24Z","snapshot_observed_at":"2026-08-07T17:36:26.589079Z","submitted_at":"2025-03-02T05:16:43Z","title":"LADDER: Self-Improving LLMs Through Recursive Problem Decomposition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.00735","snapshot_observed_at":"2026-08-07T15:42:23.014357Z","title":"Ladder: Self-improving llms through recursive problem decomposition","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.014357Z"},"links":{"cited_paper":"/paper/2503.00735","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:cd32c219e0ef9510549e8b2bb978a0ce3893114f478954f349c03baf0b5d5838","observation_id":"a274a264-6174-4a1a-8172-681ab2628e82","resolution":{"observed_at":"2026-08-07T15:42:23.014357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.497671Z","title":"Mpnet: Masked and permuted pre-training for language understanding","venue":null,"work_id":"c1821b7d-e8fc-4cad-8fce-1aa31ceb7bf6","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.136802Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:6298302262dfa7c36a35472575a18afddb5f5d998e54063aa3ab42fa6604a91e","observation_id":"5e7fb700-a741-407a-92e9-0b52eb222296","resolution":{"observed_at":"2026-08-07T15:42:29.595292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.07816","last_updated":"2024-03-12T16:54:58Z","snapshot_observed_at":"2026-07-06T17:43:27.034067Z","submitted_at":"2024-03-12T16:54:58Z","title":"Branch-Train-MiX: Mixing Expert LLMs into a Mixture-of-Experts LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.07816","snapshot_observed_at":"2026-08-07T15:42:23.213346Z","title":"Branch-train-mix: Mixing expert llms into a mixture-of-experts llm","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.213346Z"},"links":{"cited_paper":"/paper/2403.07816","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:25df8dd8c53f531441e76b7aeda125b0d4efd340f123d16d62ee51c151e3be11","observation_id":"dfe73e53-d8b5-4f2e-b67b-30beea896380","resolution":{"observed_at":"2026-08-07T15:42:23.213346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:29.186097Z","title":"Test-time training with self-supervision for generalization under distribution shifts","venue":null,"work_id":"4d914018-d035-42d3-a252-c60997e61e83","year":2020},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.341237Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:b691569cea1d1f01e37984404c2a6c6285aae25134047f32e1516665ccdf6a99","observation_id":"fc00bfb9-95cf-45aa-94f2-935c82dfdc72","resolution":{"observed_at":"2026-08-07T15:42:29.365063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04620","last_updated":"2025-08-31T18:32:59Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-05T16:23:20Z","title":"Learning to (Learn at Test Time): RNNs with Expressive Hidden States","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04620","snapshot_observed_at":"2026-08-07T15:42:23.423287Z","title":"Learning to (learn at test time): Rnns with expressive hidden states","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.423287Z"},"links":{"cited_paper":"/paper/2407.04620","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d148b2314c9f210b685b374f4fe51ef1e337062e32ca96591154342674186098","observation_id":"3b8bc1b6-06ca-4ae7-b765-9bda8c1de3b6","resolution":{"observed_at":"2026-08-07T15:42:23.423287Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.867618Z","title":"Merging multi-task models via weight-ensembling mixture of experts","venue":null,"work_id":"2d42f97f-51fa-4246-ad80-70d2602edb42","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.542167Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:fd3dac206a2040f7dc3be8eade5d6c51d2eeef17a8207efa09f1c10d4dea31d1","observation_id":"68cf8490-0673-4f87-b70d-d8acc74993ca","resolution":{"observed_at":"2026-08-07T15:42:28.982827Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.515267Z","title":"Parameter efficient multi-task model fusion with partial linearization","venue":null,"work_id":"b0667454-6b15-4f07-b0b6-109453efab88","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.635419Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:50581ae6b7779793335819a2f9f1e6c5369f10aa48b28f51fbdf842c647a30a9","observation_id":"7f389d98-efe0-4723-9799-74d1c7253320","resolution":{"observed_at":"2026-08-07T15:42:28.688694Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09522","last_updated":"2025-01-16T13:17:24Z","snapshot_observed_at":"2026-07-06T20:21:59.832347Z","submitted_at":"2025-01-16T13:17:24Z","title":"Merging Models on the Fly Without Retraining: A Sequential Approach to Scalable Continual Model Merging","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09522","snapshot_observed_at":"2026-08-07T15:42:23.729292Z","title":"Merging models on the fly without retraining: A sequential approach to scalable continual model merging","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.729292Z"},"links":{"cited_paper":"/paper/2501.09522","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:878b162c36fdb9599e0eb4d6e34b090ee6a2cec11df792052ae0fdb82e70845e","observation_id":"ca64357b-b85a-4813-8636-237212ceaa2f","resolution":{"observed_at":"2026-08-07T15:42:23.729292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:23.825753Z","title":"Self-consistency improves chain of thought reasoning in language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.825753Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:54df5914bcdd36283fe69d294337471433c2eecf09d8dd5060ca623c25c2fcdf","observation_id":"443ec839-e33c-41fb-a228-ffd1e81b1747","resolution":{"observed_at":"2026-08-07T15:42:23.825753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:28.149458Z","title":"Smooth regression analysis","venue":null,"work_id":"e95db55b-060d-42c2-8c40-333879c305df","year":1964},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:23.921104Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:de68f90572aaf7d552de21626d6904c3d53af47e3e1094028eb82d3410b66660","observation_id":"6cf2d74d-87f5-4b26-a911-bbfc510117fb","resolution":{"observed_at":"2026-08-07T15:42:28.279502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:24.011817Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.011817Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:0db58ce85aa0bd2628f5b24899f3960f1953e4c7c010ede08a213ecdc5aad1a8","observation_id":"b87c8307-b345-4f50-bd13-3f1c59dfc8c0","resolution":{"observed_at":"2026-08-07T15:42:24.011817Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.831143Z","title":"Wikimedia downloads, 2025","venue":null,"work_id":"f8351b5b-375a-4c19-86fd-1facd0a8dfbe","year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.112741Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:2e188e90846a38789267744e99f0ed2863be0abe2d0f1d550092a011c6c8e56a","observation_id":"b5cae1f6-1492-45b4-a5e6-ca02acfa4eba","resolution":{"observed_at":"2026-08-07T15:42:28.013645Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.02113","last_updated":"2025-07-10T13:56:52Z","snapshot_observed_at":"2026-08-07T17:39:13.854586Z","submitted_at":"2025-03-03T22:56:04Z","title":"Deep Learning is Not So Mysterious or Different","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.02113","snapshot_observed_at":"2026-08-07T15:42:24.192013Z","title":"Deep learning is not so mysterious or different","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.192013Z"},"links":{"cited_paper":"/paper/2503.02113","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:b74fdfba89274fbe05b9071e158c03d2a4a06bd79930d4ed19f2a195869bd22a","observation_id":"8c4aaa53-4f58-45a3-812a-b2f826223c0f","resolution":{"observed_at":"2026-08-07T15:42:24.192013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.575015Z","title":"Model soups: averaging weights of multiple fine-tuned models improves accuracy without increasing inference time","venue":null,"work_id":"e42d35cd-e6da-42e0-b2bd-2f38b7e0a65b","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.277341Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:578a6e64727dc24f7261f717a71e84827061f68d9d4cebb77966cf003603370c","observation_id":"578e2044-36f4-482a-afcf-82e20bc674e0","resolution":{"observed_at":"2026-08-07T15:42:27.648451Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:27.319885Z","title":"Ties-merging: Resolving interference when merging models","venue":null,"work_id":"84696721-ac92-4afc-ac12-1a69ea6cc08c","year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.437332Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:d352bb0ffc8d02e583d29636278d2b27e3250e534aeb7d5e07090139d0afb8fa","observation_id":"39f33703-f07d-43f9-9e5a-dc7511446229","resolution":{"observed_at":"2026-08-07T15:42:27.492986Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T15:42:24.508001Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.508001Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:89dac354356fff0403d3a6308ba699a24a98e64696dff1c89e723c5994a9b2db","observation_id":"891c9306-9037-4552-aca2-1ec5d8b41430","resolution":{"observed_at":"2026-08-07T15:42:24.508001Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.07666","snapshot_observed_at":"2026-08-07T15:42:24.591607Z","title":"Model merging in llms, mllms, and beyond: Methods, theories, applications and opportunities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.591607Z"},"links":{"cited_paper":"/paper/2408.07666","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:a8c30b21910cc4db42aac1b8f5c3ce160f2f9f36ae7bc8eb0b73f20495060879","observation_id":"7e35ebee-1598-4686-8fb5-0ffad5eedf35","resolution":{"observed_at":"2026-08-07T15:42:24.591607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.995806Z","title":"Adamerging: Adaptive model merging for multi-task learning","venue":null,"work_id":"e5e90ce5-62ca-49dc-a4e8-c30ff048ab11","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.699948Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:174a81dff3071a02dbccbf4c4dae0239ad06ee310d1543830cfe7c302c765773","observation_id":"9d33e034-3b0c-4395-9b6b-061d185616d8","resolution":{"observed_at":"2026-08-07T15:42:27.138095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.598358Z","title":"Language models are super mario: Absorbing abilities from homologous models as a free lunch","venue":null,"work_id":"d5bb42e1-eb66-4f7f-b7a6-2570f5e6dc9c","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.781502Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7170b37f5a16856ca0a1737840ab6977f9798c1b23390a87a95cf4ed1c80da93","observation_id":"40204dd1-77a3-41d2-8ba5-c3827029260e","resolution":{"observed_at":"2026-08-07T15:42:26.855130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19048","last_updated":"2025-01-23T16:01:22Z","snapshot_observed_at":"2026-08-07T06:21:24.878689Z","submitted_at":"2024-12-26T04:05:28Z","title":"Jasper and Stella: distillation of SOTA embedding models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19048","snapshot_observed_at":"2026-08-07T15:42:24.855271Z","title":"Jasper and stella: distillation of sota embedding models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.855271Z"},"links":{"cited_paper":"/paper/2412.19048","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:4328adbcfaeb47976c4d154eb7cc9715e4134b36848cfd2591ed50f3211cd73c","observation_id":"b53a7650-fd37-4c8e-b3b8-aee7469ecc20","resolution":{"observed_at":"2026-08-07T15:42:24.855271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.256993Z","title":"Bam! just like that: Simple and efficient parameter upcycling for mixture of experts","venue":null,"work_id":"b3926db6-c5bd-46f2-8c81-bdd5df936818","year":2024},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:24.949450Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:7e58a888447ffb796e09e515b4465a219c7cb223783bd733e91c871a5d61067b","observation_id":"41b49fd7-6fc4-4990-8850-8b7532f87536","resolution":{"observed_at":"2026-08-07T15:42:26.390475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.00075","last_updated":"2025-01-31T07:54:34Z","snapshot_observed_at":"2026-08-06T18:12:27.394225Z","submitted_at":"2025-01-31T07:54:34Z","title":"BTS: Harmonizing Specialized Experts into a Generalist LLM","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.00075","snapshot_observed_at":"2026-08-07T15:42:25.004379Z","title":"Bts: Harmonizing specialized experts into a generalist llm","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.004379Z"},"links":{"cited_paper":"/paper/2502.00075","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bc15ffefa8d187035fb25e04f5dcf15dfc666b6cf2f238a5f42993e86af90e88","observation_id":"44264d05-83d7-41fc-a250-54f05126a1ae","resolution":{"observed_at":"2026-08-07T15:42:25.004379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:26.196248Z","title":"Mixture-of-experts with expert choice routing","venue":null,"work_id":"343e347c-a2c8-4249-b3a5-bf7b59775e7e","year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.066864Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:256de15ca7e225becbce26233bb2c0cee5ebd181b1f7eb759b2097ee09c00119","observation_id":"5a3b67ce-acc5-45bc-9f56-0f731d495933","resolution":{"observed_at":"2026-08-07T15:42:26.222828Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.16084","last_updated":"2025-06-30T15:59:26Z","snapshot_observed_at":"2026-07-06T21:13:13.686703Z","submitted_at":"2025-04-22T17:59:56Z","title":"TTRL: Test-Time Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.16084","snapshot_observed_at":"2026-08-07T15:42:25.150277Z","title":"Ttrl: Test-time reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.150277Z"},"links":{"cited_paper":"/paper/2504.16084","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bc83cb62663d5622d58e6a3d5fb0cf50baa39562341c134ae1e730ab6474c560","observation_id":"fd4dd804-8c1e-4860-9a4b-008189c67119","resolution":{"observed_at":"2026-08-07T15:42:25.150277Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.216642Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.216642Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:bdac06476d62bba42b4e73975f9a82fa34ffc1ca0de0089bd4b9a941cb58c19e","observation_id":"0e4176ed-33f1-4360-9fc6-50259d6a4032","resolution":{"observed_at":"2026-08-07T15:42:25.216642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.292648Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.292648Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:c97fa7e7be05ba3f72c22a631f49d6969a6831035aee773bfd08f9120edfc672","observation_id":"746b7b7a-64df-4eab-8ffc-804e5633876c","resolution":{"observed_at":"2026-08-07T15:42:25.292648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.349473Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.349473Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:40cb6d4309680f95faed33bce7820007b2c0fc4a592a260b5a4b1c6b66c4461e","observation_id":"0219b703-648f-4db5-8aad-38335cbee857","resolution":{"observed_at":"2026-08-07T15:42:25.349473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T15:42:25.419709Z","title":"G5ɞ8E(wZ N8,q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:25.419709Z"},"links":{"citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:44ea6929325704b7ff6134c4e23e6e09b47df16db240304a716b7fcd999cfe22","observation_id":"e87997e7-541e-41c7-8a76-4cfb075a44ea","resolution":{"observed_at":"2026-08-07T15:42:25.419709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging"},"reference_resolution":{"displayed":83,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":33,"verified_exact":2,"verified_fuzzy":48},"total_outbound_references":83},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 83 of 83 outbound references and 4 inbound Pith citation observations for arXiv:2505.14136."}