{"as_of":"2026-08-08T18:53:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:55d34924c67d24c56aab792ab143b0f79536b0d9deeda84f33cc55b6268da291","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":23,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:41:22.247867Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"arxiv_reference","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":26,"observed_at":"2026-08-05T02:28:24.338817Z","source":"arxiv_reference"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2212.04089","last_updated":"2023-03-31T15:27:01Z","snapshot_observed_at":"2026-08-03T22:12:27.993418Z","submitted_at":"2022-12-08T05:50:53Z","title":"Editing Models with Task Arithmetic","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-13T08:09:12.716163Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2212.04089"},"observation_digest":"sha256:c74d0098a7dc2bced60ba7a1573a3941b55bb778ff5bd20ac965b29dfc6f527d","observation_id":"93a51336-5131-4fde-a1f8-d295bbeafd7f","resolution":{"observed_at":"2026-05-13T08:09:13.060337Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2408.01119","last_updated":"2026-05-12T18:55:05Z","snapshot_observed_at":"2026-08-03T11:44:22.495911Z","submitted_at":"2024-08-02T09:00:03Z","title":"Task Prompt Vectors: Effective Initialization through Multi-Task Soft-Prompt Transfer","version":4},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-23T22:11:59.206066Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2408.01119"},"observation_digest":"sha256:a8ff945af57f7f268a8e30012b8f63e095963b96e32969a8ac7dff1302ec7af2","observation_id":"1a67f19a-4f70-4387-8c2c-84c82cd66125","resolution":{"observed_at":"2026-05-23T22:13:30.125991Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2408.07666","last_updated":"2025-12-31T04:06:49Z","snapshot_observed_at":"2026-08-07T23:28:24.025478Z","submitted_at":"2024-08-14T16:58:48Z","title":"Model Merging in LLMs, MLLMs, and Beyond: Methods, Theories, Applications and Opportunities","version":5},"reference_index":121,"source":"pdf_text","source_observed_at":"2026-05-17T22:16:04.386706Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2408.07666"},"observation_digest":"sha256:804afec370882b3b50ba462ec438f3abeb26f5aa99eeb53233786feead9e37d7","observation_id":"01bb3cee-ca4e-496c-a52b-66f6bff67e97","resolution":{"observed_at":"2026-05-17T22:16:04.906658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2504.12501","last_updated":"2026-08-03T01:47:58Z","snapshot_observed_at":"2026-08-07T16:01:39.307745Z","submitted_at":"2025-04-16T21:36:46Z","title":"Reinforcement Learning from Human Feedback","version":9},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-05-22T19:27:40.991325Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2504.12501"},"observation_digest":"sha256:ac12c499d43122367f9d4c31e1d10ce5b0383f0cec4a80b7de08d9735a4ea9a5","observation_id":"204ed7b1-527f-4820-beff-4f0ec9fed988","resolution":{"observed_at":"2026-05-22T19:32:00.952905Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T15:42:21.516966Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.14136","last_updated":"2025-07-30T13:53:32Z","snapshot_observed_at":"2026-08-07T15:37:27.738096Z","submitted_at":"2025-05-20T09:39:54Z","title":"Local Mixtures of Experts: Essentially Free Test-Time Training via Model Merging","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-07T15:42:21.516966Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2505.14136"},"observation_digest":"sha256:3e2ad8aee09faff49d0e881ccf5c54e6f8bd34fbc3701b10f2088a5138142c61","observation_id":"7b058177-784b-435a-a3ff-7acf76772da6","resolution":{"observed_at":"2026-08-07T15:42:21.516966Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T04:20:02.441768Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-08T07:52:54.572018Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.441768Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:b37e00b94b8adcc4a0d60bffc42b036fc9ec40976ba4bf6c1d51eda3b7199614","observation_id":"b4b1e656-90ed-4aec-8020-cb5f269abe2c","resolution":{"observed_at":"2026-08-07T04:20:02.441768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T00:57:21.433548Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12388","last_updated":"2025-06-14T07:56:18Z","snapshot_observed_at":"2026-08-08T14:42:57.474609Z","submitted_at":"2025-06-14T07:56:18Z","title":"Group then Scale: Dynamic Mixture-of-Experts Multilingual Language Model","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T00:57:21.433548Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.12388"},"observation_digest":"sha256:eba052c3a6559349c313ddae6e76be6d9974f1516c3f087b7ffbb82dc9061cc8","observation_id":"c4151b25-40eb-487f-81f6-58055bca8106","resolution":{"observed_at":"2026-08-07T00:57:21.433548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T00:56:26.216747Z","title":"Smith, and Luke Zettlemoyer","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.12597","last_updated":"2025-06-14T18:34:38Z","snapshot_observed_at":"2026-08-07T00:43:00.229748Z","submitted_at":"2025-06-14T18:34:38Z","title":"Automatic Expert Discovery in LLM Upcycling via Sparse Interpolated Mixture-of-Experts","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T00:56:26.216747Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.12597"},"observation_digest":"sha256:949a7d90bcd0c9202dfe35cd590252cd49720df3c668f21f40679914b6e4e1eb","observation_id":"3719c411-dbc3-4766-89de-cea2be10bd24","resolution":{"observed_at":"2026-08-07T00:56:26.216747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-06T20:59:04.662169Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.03004","last_updated":"2025-07-02T06:19:40Z","snapshot_observed_at":"2026-08-07T23:04:27.033748Z","submitted_at":"2025-07-02T06:19:40Z","title":"CLUES: Collaborative High-Quality Data Selection for LLMs via Training Dynamics","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-06T20:59:04.662169Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2507.03004"},"observation_digest":"sha256:f3fbf4c3db88f3184b04b70597dfa9716d4f860adb51190d18db168ba2ea6f16","observation_id":"24e3a7d0-fe10-400a-8c73-3d34e3d9eb7e","resolution":{"observed_at":"2026-08-06T20:59:04.662169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-06T18:57:16.051548Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.07024","last_updated":"2025-08-23T00:44:49Z","snapshot_observed_at":"2026-08-08T13:03:17.550361Z","submitted_at":"2025-07-09T16:54:21Z","title":"FlexOlmo: Open Language Models for Flexible Data Use","version":4},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-06T18:57:16.051548Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2507.07024"},"observation_digest":"sha256:3325774b30dd3f2801466d2e00f52c585f97b7d3b6fc6d487bd2585d49f449c9","observation_id":"c829d2a0-d80c-476b-b417-ce674ea619e4","resolution":{"observed_at":"2026-08-06T18:57:16.051548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2604.02719","last_updated":"2026-04-03T04:22:30Z","snapshot_observed_at":"2026-07-06T22:52:02.162758Z","submitted_at":"2026-04-03T04:22:30Z","title":"MOMO: Mars Orbital Model Foundation Model for Mars Orbital Applications","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T20:47:51.509798Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2604.02719"},"observation_digest":"sha256:94696a46e024beb31060304d00ed415476df5dcad7a0b46ad6aff5d12c7f36c1","observation_id":"8f5852f7-d3e2-406d-bf99-b68c77247d1c","resolution":{"observed_at":"2026-05-13T20:48:15.103016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2604.18473","last_updated":"2026-04-20T16:24:41Z","snapshot_observed_at":"2026-07-06T23:05:21.974248Z","submitted_at":"2026-04-20T16:24:41Z","title":"Train Separately, Merge Together: Modular Post-Training with Mixture-of-Experts","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T05:52:28.822723Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2604.18473"},"observation_digest":"sha256:960287091215019154a77f8e806fb7c40baf2b4c7abe96b75fb3e7093494eff0","observation_id":"27729a76-23bc-495a-aab5-fcad434f7204","resolution":{"observed_at":"2026-05-10T05:56:11.347027Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.11170","last_updated":"2026-06-02T13:57:02Z","snapshot_observed_at":"2026-08-02T02:13:17.912919Z","submitted_at":"2026-05-11T19:28:33Z","title":"Unlearning with Asymmetric Sources: Improved Unlearning-Utility Trade-off with Public Data","version":1},"reference_index":162,"source":"arxiv_source","source_observed_at":"2026-05-13T05:56:38.042978Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.11170"},"observation_digest":"sha256:543c682fe2d683df1d64d3820b7c3e0a444ed0351652f18bbbd9b5acd3d578e1","observation_id":"4602cde6-ba2d-4709-b06d-03129ada670e","resolution":{"observed_at":"2026-05-13T05:57:21.795138Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.13997","last_updated":"2026-05-13T18:07:12Z","snapshot_observed_at":"2026-07-06T23:25:29.856145Z","submitted_at":"2026-05-13T18:07:12Z","title":"HodgeCover: Higher-Order Topological Coverage Drives Compression of Sparse Mixture-of-Experts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-15T05:54:32.496951Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.13997"},"observation_digest":"sha256:df030ec7d88bdd38cc870946cfe8beea1c513cdb804cca8dddaf8b6bcb139aec","observation_id":"3dd25be9-893f-46ef-be1f-1dafa8d7d156","resolution":{"observed_at":"2026-05-15T05:55:04.758253Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.14289","last_updated":"2026-05-14T02:48:23Z","snapshot_observed_at":"2026-08-06T17:26:19.586193Z","submitted_at":"2026-05-14T02:48:23Z","title":"MetaMoE: Diversity-Aware Proxy Selection for Privacy-Preserving Mixture-of-Experts Unification","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-15T02:21:10.641070Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.14289"},"observation_digest":"sha256:38e4386ae46d625dab66797905470a47c9b85992e4d11df32f676dab47b5d477","observation_id":"30bd7b97-324e-431d-9077-40337fc42078","resolution":{"observed_at":"2026-05-15T02:23:31.881288Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2605.19095","last_updated":"2026-05-18T20:31:49Z","snapshot_observed_at":"2026-07-06T23:29:52.061489Z","submitted_at":"2026-05-18T20:31:49Z","title":"ScheduleFree+: Scaling Learning-Rate-Free & Schedule-Free Learning to Large Language Models","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-20T12:22:30.263086Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2605.19095"},"observation_digest":"sha256:bd8cc7e4dcbe16861598e67d4dad55c09562368aa4cf41f0aad16cd47506ae87","observation_id":"6bef364a-0d99-4d45-9728-c51e1b4e1419","resolution":{"observed_at":"2026-05-20T12:23:16.769512Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2606.24722","last_updated":"2026-07-03T16:29:30Z","snapshot_observed_at":"2026-07-12T12:29:29.101092Z","submitted_at":"2026-06-23T15:47:33Z","title":"Decentralised AI Training and Inference with BlockTrain","version":1},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-06-25T23:32:43.585170Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.24722"},"observation_digest":"sha256:0095ccee6087049a558a8a0659434e0fd3895e99987481c8fcb8c90a175807e8","observation_id":"a6aac792-d8ae-41bb-b993-f2616357ffba","resolution":{"observed_at":"2026-07-04T17:40:00.431608Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-07-12T12:29:35.403453Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.24722","last_updated":"2026-07-03T16:29:30Z","snapshot_observed_at":"2026-07-12T12:29:29.101092Z","submitted_at":"2026-06-23T15:47:33Z","title":"Decentralised AI Training and Inference with BlockTrain","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-12T12:29:35.403453Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.24722"},"observation_digest":"sha256:be4fd4a4d898a9efa887f34891682008f45429609655d84a45234fd80a9203a4","observation_id":"cd94ee50-d4a0-4886-b0fe-3a2337f9ecdb","resolution":{"observed_at":"2026-07-12T12:29:35.403453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2606.31796","last_updated":"2026-07-23T16:29:18Z","snapshot_observed_at":"2026-08-03T13:02:28.914044Z","submitted_at":"2026-06-30T15:14:38Z","title":"CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-01T05:46:40.510955Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.31796"},"observation_digest":"sha256:c78529a6a07589880138cb414288985a035a7c4c21c35efbebf3975df53f8777","observation_id":"256c947c-611d-4a69-baa4-1ab1b55861fc","resolution":{"observed_at":"2026-07-01T10:15:44.043684Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-02T09:24:14.388774Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.31796","last_updated":"2026-07-23T16:29:18Z","snapshot_observed_at":"2026-08-03T13:02:28.914044Z","submitted_at":"2026-06-30T15:14:38Z","title":"CHERRY: Compressed Hierarchical Experts with Recurrent Representational Yield","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T09:24:14.388774Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2606.31796"},"observation_digest":"sha256:6295e0f809431ad2be8ec3aecce95a238b7678cac1438f67fd0d9b860b272ae0","observation_id":"93570348-03da-426a-ba90-993117dbef4a","resolution":{"observed_at":"2026-08-02T09:24:14.388774Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":"2208.03306","doi":"10.48550/arxiv.2208.03306","metadata_source":"arxiv_reference","pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":"arXiv (Cornell University)","work_id":"53f249ec-fe00-4890-9c6f-64582a367d17","year":2022},"citing_paper":{"arxiv_id":"2607.00620","last_updated":"2026-07-01T08:40:46Z","snapshot_observed_at":"2026-07-07T00:06:14.968413Z","submitted_at":"2026-07-01T08:40:46Z","title":"Identifying Latent Concepts and Structures for Generalized Category Discovery","version":1},"reference_index":127,"source":"arxiv_source","source_observed_at":"2026-07-02T14:42:01.334822Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2607.00620"},"observation_digest":"sha256:4162183304f62a6ba002315a9b6280f4966d470aa82b55688340f245d8c4cd58","observation_id":"f25ca2e0-bf00-4380-9012-68d56b699d0d","resolution":{"observed_at":"2026-07-02T14:47:03.350280Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-07-12T01:22:51.284207Z","title":"Smith and Luke Zettlemoyer , title =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.03585","last_updated":"2026-07-03T20:02:28Z","snapshot_observed_at":"2026-08-02T18:24:57.296412Z","submitted_at":"2026-07-03T20:02:28Z","title":"Modular Foundation Models for Time-Series Perception in Digital Twins","version":1},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-07-12T01:22:51.284207Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2607.03585"},"observation_digest":"sha256:3fd8896cb24cb68aff2ccb40bb91113bbc46c7fa304ad70d56d44904e86c159c","observation_id":"f601a8d1-a5d2-4f76-965d-e75617e19f10","resolution":{"observed_at":"2026-07-12T01:22:51.284207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-08T00:41:22.247867Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04084","last_updated":"2026-08-04T18:00:01Z","snapshot_observed_at":"2026-08-08T18:10:48.717680Z","submitted_at":"2026-08-04T18:00:01Z","title":"SpecDrop: Parameter-Free Category-Conditioned Routing for Modular Specialization","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-08T00:41:22.247867Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2608.04084"},"observation_digest":"sha256:1c3361ebd6f8b290bc6daaf3616e1b5dfe38dabfe840a928f49f7c78d7b5541c","observation_id":"c2433688-1c4c-4442-a014-c6bea26815e8","resolution":{"observed_at":"2026-08-08T00:41:22.247867Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2208.03306/citation-record","integrity":"/paper/2208.03306/integrity","json":"/paper/2208.03306/citation-record.json","paper":"/paper/2208.03306"},"outbound":[],"paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 23 inbound Pith citation observations for arXiv:2208.03306."}