{"as_of":"2026-08-10T02:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c37331717ab47d09653d3d687172b1fc56fdba417f60c24472308a5dcaeffb1c","coverage":[{"denominator":46,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":46,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T14:27:57.561399Z","state":"measured"},{"denominator":46,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":46,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2502.01804/citation-record","integrity":"/paper/2502.01804/integrity","json":"/paper/2502.01804/citation-record.json","paper":"/paper/2502.01804"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.12370","last_updated":"2025-07-02T20:37:41Z","snapshot_observed_at":"2026-08-07T03:52:12.288342Z","submitted_at":"2025-01-21T18:51:15Z","title":"Parameters vs FLOPs: Scaling Laws for Optimal Sparsity for Mixture-of-Experts Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12370","snapshot_observed_at":"2026-08-09T14:27:57.391563Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.391563Z"},"links":{"cited_paper":"/paper/2501.12370","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:676780bbbadd25343004cae262b59bc6835afd4758247f1318e873a13fec8b5d","observation_id":"d8853291-31a6-4438-838c-e8177ea277fc","resolution":{"observed_at":"2026-08-09T14:27:57.391563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.396007Z","title":"Ensemble of averages: Improving model selection and boosting performance in domain generalization","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.396007Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5f87b23cbb0ac03b52350e63b4d489171206d0359fc66e402740b3710ea4e423","observation_id":"36c7597e-646b-4b7d-9bcc-b4aa6344e198","resolution":{"observed_at":"2026-08-09T14:27:57.396007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07258","last_updated":"2022-07-12T23:45:14Z","snapshot_observed_at":"2026-08-02T09:20:40.804790Z","submitted_at":"2021-08-16T17:50:08Z","title":"On the Opportunities and Risks of Foundation Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07258","snapshot_observed_at":"2026-08-09T14:27:57.400087Z","title":"A., Adeli, E., Altman, R., Arora, S., von Arx, S., Bernstein, M","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.400087Z"},"links":{"cited_paper":"/paper/2108.07258","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a77ffac6022ec99d89660c0176b03eb8d85250b44bf72e518e5ccf21330acb0e","observation_id":"dd5c57d8-ee63-42bb-95dd-e47857dbbeb0","resolution":{"observed_at":"2026-08-09T14:27:57.400087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.404425Z","title":null,"venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.404425Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5fbb455d079eb848822275d432eee1490f49acad85976cc1f9b21f0474a18fd6","observation_id":"f408d395-f482-4108-a0ad-dba645e9922d","resolution":{"observed_at":"2026-08-09T14:27:57.404425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03044","last_updated":"2022-04-06T18:54:48Z","snapshot_observed_at":"2026-08-05T18:37:24.892453Z","submitted_at":"2022-04-06T18:54:48Z","title":"Fusing finetuned models for better pretraining","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.03044","snapshot_observed_at":"2026-08-09T14:27:57.408331Z","title":"Fusing finetuned models for better pretraining","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.408331Z"},"links":{"cited_paper":"/paper/2204.03044","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:aebea737bdcf786f61abd734afca267ddc4dab47b28c3bd5a3647e00d03517ef","observation_id":"feb98c8f-41b0-4247-8458-6caf21c33376","resolution":{"observed_at":"2026-08-09T14:27:57.408331Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-09T14:27:57.412285Z","title":"X., Gao, H., Chen, D., Li, J., Zeng, W., Yu, X., Wu, Y., Xie, Z., Li, Y","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.412285Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:7232b2874879e6e27085e4abb51b27b9abad0be190e1cb8c9b72255bf0401a1f","observation_id":"60b0b9d2-5d8d-402c-a46a-6a79e9e9d94b","resolution":{"observed_at":"2026-08-09T14:27:57.412285Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-09T14:27:57.416519Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.416519Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5fcb4d78fcacb96362b9fc708102b74b67c2ea23fd45aca13bd1ac439ea5a69e","observation_id":"73f5ab54-1ee5-447a-8adc-e30fed190887","resolution":{"observed_at":"2026-08-09T14:27:57.416519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.080983Z","title":"Pareto manifold learning: Tackling multiple tasks via ensembles of single-task models","venue":null,"work_id":"584b489d-12e0-47fb-86b9-85f78a734e43","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.420385Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:2cb0acee0ba3be996b2558ee61871954d9e46c3df499f163b1d41b8c965a7246","observation_id":"d5fca2ec-fa38-4895-bcc6-21d032854460","resolution":{"observed_at":"2026-08-09T14:27:58.086718Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-04T02:07:01.235387Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-09T14:27:57.423803Z","title":"Understanding emergent abilities of language models from the loss perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.423803Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e7fbe4d2fbb55f5d3c855fcb9cd5de652c60b1201684cb5052b8c31a66dd67b1","observation_id":"e84ceb55-0f61-4ce1-b195-7ba48fdcab56","resolution":{"observed_at":"2026-08-09T14:27:57.423803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-09T14:27:57.427749Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.427749Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:0de53c57b0dbedf6dd642f6a19f9c34085f93d84d692c4c7bb9b0d69e44fa5bf","observation_id":"78e44852-42e8-403c-b09c-12ae7f0cb577","resolution":{"observed_at":"2026-08-09T14:27:57.427749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15393","last_updated":"2024-02-05T16:33:05Z","snapshot_observed_at":"2026-08-09T06:27:27.325450Z","submitted_at":"2023-10-23T22:51:58Z","title":"DoGE: Domain Reweighting with Generalization Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15393","snapshot_observed_at":"2026-08-09T14:27:57.431339Z","title":"Doge: Domain reweighting with generalization estimation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.431339Z"},"links":{"cited_paper":"/paper/2310.15393","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:b423984ab8dc51386e1aeee106d3451ebd7e855c87a9a0b1edebe4a075efbd3d","observation_id":"253c7a5c-2696-4055-82b8-a1b0bab31ecc","resolution":{"observed_at":"2026-08-09T14:27:57.431339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02498","last_updated":"2024-10-03T14:00:44Z","snapshot_observed_at":"2026-08-09T06:28:00.253928Z","submitted_at":"2024-10-03T14:00:44Z","title":"Dynamic Gradient Alignment for Online Data Mixing","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02498","snapshot_observed_at":"2026-08-09T14:27:57.434779Z","title":"Dynamic gradient alignment for online data mixing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.434779Z"},"links":{"cited_paper":"/paper/2410.02498","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:3e41963580e103810ef71bb969c3a8cfb780117ab6244fb3710e41dd9bf0d8e0","observation_id":"161d34cb-2394-49f7-9871-818fd68db1ec","resolution":{"observed_at":"2026-08-09T14:27:57.434779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-04T15:45:56.618823Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-09T14:27:57.438208Z","title":"A review of sparse expert models in deep learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.438208Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:8dd67147c183e703a16ececb4d4210bc18de9d2c79e37f47bd4f365626805ee3","observation_id":"11e84925-235f-4796-9d8d-0207ad581f70","resolution":{"observed_at":"2026-08-09T14:27:57.438208Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.066838Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"928f3691-2b3b-417e-84df-bf6f35258b21","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.441375Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:5825c378b8884e357cfe1c289eea40014dc371f7fb346e47693389deb64a8bf0","observation_id":"dfe26220-49f0-4b71-a9b3-2ebac4de105f","resolution":{"observed_at":"2026-08-09T14:27:58.071793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08540","last_updated":"2024-06-14T20:21:05Z","snapshot_observed_at":"2026-07-06T17:43:56.860733Z","submitted_at":"2024-03-13T13:54:00Z","title":"Language models scale reliably with over-training and on downstream tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08540","snapshot_observed_at":"2026-08-09T14:27:57.445085Z","title":"Y., Smyrnis, G., Shankar, V., Gururangan, S., Wortsman, M., Shao, R., Mercat, J., Fang, A., Li, J., Keh, S., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.445085Z"},"links":{"cited_paper":"/paper/2403.08540","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:7aa17a2d7bf209de681326236f4b274cd504f9f21bcd68513c1c887235e65781","observation_id":"51ea79ca-b8ea-4326-9a21-2ceaa9d89f8f","resolution":{"observed_at":"2026-08-09T14:27:57.445085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-09T14:27:57.449094Z","title":"The pile: An 800gb dataset of diverse text for language modeling","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.449094Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:24a185ad16d5ffdf2062ecf7d5ccaa79ec412b8f912cb94b214bbaa243d0b3b0","observation_id":"e56c246c-31cd-4f83-a061-a65fcaf2b04a","resolution":{"observed_at":"2026-08-09T14:27:57.449094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04037","last_updated":"2024-09-12T19:54:37Z","snapshot_observed_at":"2026-08-07T11:18:39.827875Z","submitted_at":"2022-12-08T02:21:47Z","title":"Demystifying Prompts in Language Models via Perplexity Estimation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04037","snapshot_observed_at":"2026-08-09T14:27:57.452868Z","title":"A., and Zettlemoyer, L","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.452868Z"},"links":{"cited_paper":"/paper/2212.04037","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:57a534df09c123d03bf394431626585c04470b97775b23d8838612cbb2e4ece8","observation_id":"c269444f-8b4a-4398-a1f9-52d7e5fa46c4","resolution":{"observed_at":"2026-08-09T14:27:57.452868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.054716Z","title":"Adaptive training distributions with scalable online bilevel optimization","venue":null,"work_id":"75bb4f0a-5dac-49ee-b749-5636de6276e7","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.456462Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:02093b51a2cc1d1cb5f03351d3e2309a49c5bfae01bc8a59f409ad3d2fbd6d4f","observation_id":"82923042-9307-4469-b0eb-b2f623bfbf6a","resolution":{"observed_at":"2026-08-09T14:27:58.059125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03735","last_updated":"2025-03-11T00:20:30Z","snapshot_observed_at":"2026-08-09T06:27:43.634379Z","submitted_at":"2024-09-30T20:49:54Z","title":"Task-Adaptive Pretrained Language Models via Clustered-Importance Sampling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03735","snapshot_observed_at":"2026-08-09T14:27:57.460128Z","title":"Task-adaptive pretrained language models via clustered-importance sampling","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.460128Z"},"links":{"cited_paper":"/paper/2410.03735","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:92213a320cec18fb198c9c581b21a138cc7f7a71a79aa295fac713cf30e3367a","observation_id":"b08e76ba-e5e0-4789-ae2f-033f557d9885","resolution":{"observed_at":"2026-08-09T14:27:57.460128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.042523Z","title":"Hard mixtures of experts for large scale weakly supervised vision","venue":null,"work_id":"0340b64c-6f1e-4a07-8e13-57a004a3c378","year":2017},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.463977Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:269abf6843dacb75839e5530eefa1ace49e929eb0e99241633edecca05c4978b","observation_id":"84c69eca-4bc3-4985-9bb4-c61d6c11baf3","resolution":{"observed_at":"2026-08-09T14:27:58.046874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.029765Z","title":"MiniLLM : Knowledge distillation of large language models","venue":null,"work_id":"b91222f0-2616-476e-ab13-9d03493b0dd4","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.467487Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:fdcce967fd6d6d5e743d5c395cca7f8aa46904bbca877703a6c57285dbbb3e12","observation_id":"88c8c2b4-1ca4-47fa-8016-cb09b1ebf898","resolution":{"observed_at":"2026-08-09T14:27:58.034269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-07T07:43:16.294957Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-09T14:27:57.471035Z","title":"J., Shen, Y., Wallis, P., Allen-Zhu, Z., Li, Y., Wang, S., Wang, L., and Chen, W","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.471035Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:8464ecb374cfd6fa06f6e55351209796c2a2242fdbed3ec86eed571d4cc13097","observation_id":"d14bff1a-2729-4624-a010-25750b77502a","resolution":{"observed_at":"2026-08-09T14:27:57.471035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13269","last_updated":"2024-08-19T03:31:19Z","snapshot_observed_at":"2026-07-06T15:58:08.777051Z","submitted_at":"2023-07-25T05:39:21Z","title":"LoraHub: Efficient Cross-Task Generalization via Dynamic LoRA Composition","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13269","snapshot_observed_at":"2026-08-09T14:27:57.474822Z","title":"Y., Pang, T., Du, C., and Lin, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.474822Z"},"links":{"cited_paper":"/paper/2307.13269","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:d86395ccaefc81eb9a9448b8bb599f85ee8fcb7b1daf9cfb43025b412d7af78e","observation_id":"b40ae42d-0f3e-4bb2-b432-76a066acc317","resolution":{"observed_at":"2026-08-09T14:27:57.474822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.04089","snapshot_observed_at":"2026-08-09T14:27:57.478584Z","title":"T., Wortsman, M., Gururangan, S., Schmidt, L., Hajishirzi, H., and Farhadi, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.478584Z"},"links":{"cited_paper":"/paper/2212.04089","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:47e1e8d41379feb409ee3a6c0ecea35e6e832a729e5c9ce134f58f7c9f6e0db0","observation_id":"0c026c98-4752-4671-8734-56aaf4aeb769","resolution":{"observed_at":"2026-08-09T14:27:57.478584Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-09T14:27:57.482212Z","title":"Q., Sablayrolles, A., Mensch, A., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.482212Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:f4418329c4cdfc07d5fc5892888bb6121b42861df9f7bd70eb96cabe39a03ac5","observation_id":"b3d6253a-fe63-4121-ad08-89e0ec34babb","resolution":{"observed_at":"2026-08-09T14:27:57.482212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-09T14:27:57.486070Z","title":"Q., Sablayrolles, A., Roux, A., Mensch, A., Savary, B., Bamford, C., Chaplot, D","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.486070Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:49db28a4e911b05a80a4b74ead8caa577d34c4bece1e2d6bbdcb40528e793dae","observation_id":"dfde294a-c936-4492-9067-f943d5e6baa1","resolution":{"observed_at":"2026-08-09T14:27:57.486070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-09T14:27:57.490125Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.490125Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:4899ce8105f44651e4087b1fe7c97454f18bb4838a8c23b185ef96ac05aeade3","observation_id":"c19c0c4b-8781-48de-b369-9a39376106a6","resolution":{"observed_at":"2026-08-09T14:27:57.490125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-09T14:27:57.493957Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.493957Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:e350192f2ef9ed9542423c951bd2c3bf3526f1b516cc352e6aaf78a63ee8963d","observation_id":"2745ea1f-7427-405e-851a-79a3be989fa8","resolution":{"observed_at":"2026-08-09T14:27:57.493957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.016618Z","title":"Evaluating quantized large language models","venue":null,"work_id":"5900b305-4998-450d-aa8f-06d2afc06fe2","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.497889Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:80a3765026d073e5320a11b099264e3ed949337f66936c1fa86d09b21977040e","observation_id":"bf38f286-0ecc-4312-a1c4-35e60eafe9e7","resolution":{"observed_at":"2026-08-09T14:27:58.021236Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:58.002899Z","title":"LLM-Pruner : On the structural pruning of large language models","venue":null,"work_id":"ab9cf913-a78c-4448-b9bd-2ccb02f9c877","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.501526Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:1c4f2edd54541bd33b3e71cbca7d37883fe4909bce5eead31cc08c773882c576","observation_id":"dfa78e05-8bbf-47bd-9645-58cc9e40dd9a","resolution":{"observed_at":"2026-08-09T14:27:58.007734Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.990281Z","title":"Task arithmetic in the tangent space: Improved editing of pre-trained models","venue":null,"work_id":"f448c2b0-015d-497b-8bb2-9b51fc74925d","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.505793Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:0704c0b32e76ae91cc5f9cca43db0ab185d31b43560bd11154bea9eb856db1dc","observation_id":"58b1f7da-f0d7-44b4-91dd-d26fec265c93","resolution":{"observed_at":"2026-08-09T14:27:57.994722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.05567","last_updated":"2024-04-08T14:39:49Z","snapshot_observed_at":"2026-08-08T01:59:38.874840Z","submitted_at":"2024-04-08T14:39:49Z","title":"Dense Training, Sparse Inference: Rethinking Training of Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.05567","snapshot_observed_at":"2026-08-09T14:27:57.509397Z","title":"Dense training, sparse inference: Rethinking training of mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.509397Z"},"links":{"cited_paper":"/paper/2404.05567","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:cd91be96d3d51f4af1c41dfe6301cb68349add1e45063d7bb16e37711c73c615","observation_id":"427b3fff-99d2-4f59-8d94-36d76c0383d9","resolution":{"observed_at":"2026-08-09T14:27:57.509397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.976129Z","title":"Diverse weight averaging for out-of-distribution generalization","venue":null,"work_id":"9de225a1-4d3d-4400-a561-b5c8345c9276","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.513283Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:417ff19029161af20b4927e33d0098ce23e0c03b41615a40fe3593429aad5a3c","observation_id":"4f337655-4d5b-4423-9baa-1ac280c93dfa","resolution":{"observed_at":"2026-08-09T14:27:57.981377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.963724Z","title":"Model ratatouille: Recycling diverse models for out-of-distribution generalization","venue":null,"work_id":"23b5926d-d3c2-438b-886b-ea0ddeec6745","year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.516804Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a29cf55bd8160bc0f6610939fc07fc0554fdba7f378e024b607b8c74e0268adf","observation_id":"46644d6d-fc48-48b0-bc87-de9253bcb8f6","resolution":{"observed_at":"2026-08-09T14:27:57.967482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.952101Z","title":"Rewarded soups: towards pareto-optimal alignment by interpolating weights fine-tuned on diverse rewards","venue":null,"work_id":"90d0caab-313a-4480-b19f-9ca5671f1903","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.520952Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:3ec3a5c50f320ce170a8765ed57f1da8e0fbb6454f31de83fa5e70d3c2bbe2db","observation_id":"27462a9f-c869-4aaf-9e3c-930437dfe036","resolution":{"observed_at":"2026-08-09T14:27:57.956064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-09T14:27:57.524414Z","title":"G., Hardin, C., Bhupatiraju, S., Hussenot, L., Mesnard, T., Shahriari, B., Ram \\'e , A., et al","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.524414Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:f247459d33dd29696e016d097d2fa3e62d9aa1e15299ba6d8c5314de4dca3458","observation_id":"c4d32ccf-b590-4ca8-b125-6fa924230722","resolution":{"observed_at":"2026-08-09T14:27:57.524414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-09T14:27:57.527885Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.527885Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:241d3ed49bb92526053e6ee8e987896e40a254ca1362c731ba0887bfa52a8a0c","observation_id":"e4f29297-d2e5-435b-b527-e50f9296ed6a","resolution":{"observed_at":"2026-08-09T14:27:57.527885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.18314","last_updated":"2024-09-26T21:44:20Z","snapshot_observed_at":"2026-07-06T19:23:06.818254Z","submitted_at":"2024-09-26T21:44:20Z","title":"Realistic Evaluation of Model Merging for Compositional Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.18314","snapshot_observed_at":"2026-08-09T14:27:57.531857Z","title":"Realistic evaluation of model merging for compositional generalization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.531857Z"},"links":{"cited_paper":"/paper/2409.18314","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:2252ab4e052d05e43cc3b339e98ffc6afc1b67b5ff81ad8cda3e4082923236fd","observation_id":"bdf10fbd-1173-4d8d-92af-32373de6e98e","resolution":{"observed_at":"2026-08-09T14:27:57.531857Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.939701Z","title":"Efficient large language models: A survey","venue":null,"work_id":"648ba7e3-b9ab-49d9-8916-0b1a180297cd","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.535349Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:4cf6cb8c020c0423b2575f77bb2aa740c08662627287e91fe20427120df6fa87","observation_id":"025f7d6c-2553-4731-87aa-2563046a66ed","resolution":{"observed_at":"2026-08-09T14:27:57.944220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.927484Z","title":"T., Wu, T., Song, D., Mittal, P., and Jia, R","venue":null,"work_id":"1f2af1d0-9054-49cb-9fed-c11bbead597a","year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.538832Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a011ee52eb82d3121e7d81cf159f8c19713aa9cb8b93660baed836ad97f376ca","observation_id":"3043a95d-cf58-44b5-9822-d5c72ff727a3","resolution":{"observed_at":"2026-08-09T14:27:57.931671Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12372","last_updated":"2024-11-19T09:35:28Z","snapshot_observed_at":"2026-08-06T21:35:45.662025Z","submitted_at":"2024-11-19T09:35:28Z","title":"RedPajama: an Open Dataset for Training Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12372","snapshot_observed_at":"2026-08-09T14:27:57.542454Z","title":"Redpajama: an open dataset for training large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.542454Z"},"links":{"cited_paper":"/paper/2411.12372","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:4d81c44b98445f691a3e4deeec07e6eef25f09d682434cdc61d836fce509745d","observation_id":"2faa9b3a-7af2-45e2-becb-87d3f888bdad","resolution":{"observed_at":"2026-08-09T14:27:57.542454Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.913670Z","title":"Y., Roelofs, R., Gontijo-Lopes, R., Morcos, A","venue":null,"work_id":"20de32c5-13e5-4ea7-8d65-e441bb2435fe","year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.546212Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:a8c699f401048574ba17380de9326f7ff02684dc20a70b97a22edbdd3067045a","observation_id":"4d0d2575-1cf5-4df2-a85a-ac6c08caa8c3","resolution":{"observed_at":"2026-08-09T14:27:57.919199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.549919Z","title":"Structured pruning learns compact and accurate models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.549919Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:9826de96a06f0f8042d24e064d12aa76140a8486f3ec1a435fddb34df6d86c2a","observation_id":"cda5a5a6-bfab-46eb-a2c2-8ed6b42dd7dd","resolution":{"observed_at":"2026-08-09T14:27:57.549919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06694","last_updated":"2024-04-11T01:18:06Z","snapshot_observed_at":"2026-08-08T20:21:38.269492Z","submitted_at":"2023-10-10T15:13:30Z","title":"Sheared LLaMA: Accelerating Language Model Pre-training via Structured Pruning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06694","snapshot_observed_at":"2026-08-09T14:27:57.553441Z","title":"Sheared llama: Accelerating language model pre-training via structured pruning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.553441Z"},"links":{"cited_paper":"/paper/2310.06694","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:9d94d8b0fd27f477955e55744926c4b95ecdfe3bdce10c26d4f9de3e3433a772","observation_id":"bb2ab740-b7eb-4d1f-ba23-f443ee314bdf","resolution":{"observed_at":"2026-08-09T14:27:57.553441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10429","last_updated":"2023-11-21T02:01:53Z","snapshot_observed_at":"2026-08-09T06:27:16.635132Z","submitted_at":"2023-05-17T17:58:13Z","title":"DoReMi: Optimizing Data Mixtures Speeds Up Language Model Pretraining","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10429","snapshot_observed_at":"2026-08-09T14:27:57.557385Z","title":"M., Pham, H., Dong, X., Du, N., Liu, H., Lu, Y., Liang, P., Le, Q","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.557385Z"},"links":{"cited_paper":"/paper/2305.10429","citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:4a6a7343a989da44dd2f530e5b0dc5206a57c4a8207a3b565127f9a26abb3a63","observation_id":"aa434cf1-ebd4-4aef-9ead-0802752e0920","resolution":{"observed_at":"2026-08-09T14:27:57.557385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-09T14:27:57.561399Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-09T14:27:57.561399Z"},"links":{"citing_paper":"/paper/2502.01804"},"observation_digest":"sha256:7af29607cdf2bc24ce4fa15ec459243ef07c6ecf5942b4f595f018343e4512bb","observation_id":"c1156ac8-7ef6-4773-9ce7-1b3eacfd4c53","resolution":{"observed_at":"2026-08-09T14:27:57.561399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.01804","last_updated":"2025-02-03T20:33:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T01:51:21.193055Z","submitted_at":"2025-02-03T20:33:20Z","title":"Soup-of-Experts: Pretraining Specialist Models via Parameters Averaging"},"reference_resolution":{"displayed":46,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":32,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":46},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 46 of 46 outbound references and 0 inbound Pith citation observations for arXiv:2502.01804."}