{"as_of":"2026-08-08T04:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8862d0492e655a5a5558d8650713e44272c05c377460948f3ec66e808fe7ef91","coverage":[{"denominator":31,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":31,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T04:20:04.267992Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":5,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":5,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-12T12:16:10.904456Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T04:07:37.154141Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2507.06542","last_updated":"2026-04-27T10:34:05Z","snapshot_observed_at":"2026-08-06T23:52:48.965163Z","submitted_at":"2025-07-09T04:56:56Z","title":"On the Surprising Effectiveness of a Single Global Merging in Decentralized Learning","version":4},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-19T05:39:53.088948Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2507.06542"},"observation_digest":"sha256:4be39cc98f2f946702f3641d5a784e2541b2d87bebc5348dba262adc151ecb9e","observation_id":"9f4ddb48-f020-4438-8ec9-11deb9df7c3c","resolution":{"observed_at":"2026-05-19T05:42:06.077358Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2604.21428","last_updated":"2026-04-23T08:45:38Z","snapshot_observed_at":"2026-07-06T23:08:01.670049Z","submitted_at":"2026-04-23T08:45:38Z","title":"Decoupled DiLoCo for Resilient Distributed Pre-training","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-09T22:20:21.090246Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2604.21428"},"observation_digest":"sha256:9153d07ba09dbde6d531c63632ebfc5a46cde01e96cdabed04857e1b6132eb49","observation_id":"d5a3b6dc-44df-48ab-b0e6-d5b776525c35","resolution":{"observed_at":"2026-05-09T22:49:15.635560Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2606.00271","last_updated":"2026-05-29T19:02:10Z","snapshot_observed_at":"2026-08-06T23:05:44.963983Z","submitted_at":"2026-05-29T19:02:10Z","title":"HeLoCo: Efficient asynchronous low-communication training under data and device heterogeneity","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-06-28T20:45:29.941331Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2606.00271"},"observation_digest":"sha256:c89ba8f5013055af451c6cb41852a5dea9fbb2fa2b3423eeecfd93f801e81888","observation_id":"1369cf40-bbcb-47e1-8b3d-2acc0ba81afd","resolution":{"observed_at":"2026-06-28T20:52:37.872136Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":"2506.10911","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-03T04:07:37.154141Z","title":"Kolehmainen, N","venue":null,"work_id":"8037d872-e359-4b30-b168-ae73cec1abf7","year":2025},"citing_paper":{"arxiv_id":"2606.11081","last_updated":"2026-06-09T16:40:54Z","snapshot_observed_at":"2026-08-03T08:40:34.396170Z","submitted_at":"2026-06-09T16:40:54Z","title":"Unifying Local Communications and Local Updates for LLM Pretraining","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-27T14:07:42.062805Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2606.11081"},"observation_digest":"sha256:e05688a4d8e464f1737cbeb76133ff2bde013bb5e6e4fb993c08e2f0e07f8151","observation_id":"4ee2c74a-bab3-43c8-8200-9d4ed470519e","resolution":{"observed_at":"2026-07-03T04:07:37.155683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10911","snapshot_observed_at":"2026-07-12T12:16:10.904456Z","title":"2025 , eprint =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.02544","last_updated":"2026-06-24T05:57:19Z","snapshot_observed_at":"2026-08-07T01:41:05.813944Z","submitted_at":"2026-06-24T05:57:19Z","title":"Not Every Sync Is Safe: Calibrated DiLoCo Scheduling for Shared AI Infrastructure","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-07-12T12:16:10.904456Z"},"links":{"cited_paper":"/paper/2506.10911","citing_paper":"/paper/2607.02544"},"observation_digest":"sha256:8d5ce6788cb916a95a1fd970deda690991174dd9404209b1b640fefc4bc8234e","observation_id":"20fcc947-712b-4d19-80f8-a8be10b42200","resolution":{"observed_at":"2026-07-12T12:16:10.904456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.10911/citation-record","integrity":"/paper/2506.10911/integrity","json":"/paper/2506.10911/citation-record.json","paper":"/paper/2506.10911"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:04.963450Z","title":null,"venue":null,"work_id":"5f73a40d-2bdc-4e72-9852-09a216839fd2","year":2013},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.267992Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:f029c239172969a035674fa941e4844b1677ea66cca27b1d08ae83283750aa95","observation_id":"17186e22-de31-4b7b-80cc-87472de0c03a","resolution":{"observed_at":"2026-08-07T04:20:05.026257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.09799","last_updated":"2025-03-12T20:04:38Z","snapshot_observed_at":"2026-08-07T17:09:02.220829Z","submitted_at":"2025-03-12T20:04:38Z","title":"Communication-Efficient Language Model Training Scales Reliably and Robustly: Scaling Laws for DiLoCo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.09799","snapshot_observed_at":"2026-08-07T04:20:01.105792Z","title":"Communication-efficient language model training scales reliably and robustly: Scaling laws for diloco.arXiv preprint arXiv:2503.09799,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.105792Z"},"links":{"cited_paper":"/paper/2503.09799","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:a1b816a9b947854d371dcb77b0572fe1ed521831111f8e168a7f75a30f257a04","observation_id":"b44aafe4-29b1-4f1c-b8fb-76420366909f","resolution":{"observed_at":"2026-08-07T04:20:01.105792Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.20018","last_updated":"2024-07-29T13:53:27Z","snapshot_observed_at":"2026-07-06T18:53:22.585501Z","submitted_at":"2024-07-29T13:53:27Z","title":"Efficient Training of Large Language Models on Distributed Infrastructures: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.20018","snapshot_observed_at":"2026-08-07T04:20:01.632451Z","title":"Efficient training of large language models on distributed infrastructures: a survey.arXiv preprint arXiv:2407.20018,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.632451Z"},"links":{"cited_paper":"/paper/2407.20018","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:210e78924bdf9b86391db947c90cdd9a6b47c1f319b5fa06f63c727f37da7a4d","observation_id":"dc4ae879-c1d3-40eb-9951-968107914fb6","resolution":{"observed_at":"2026-08-07T04:20:01.632451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.06465","last_updated":"2024-11-10T13:45:08Z","snapshot_observed_at":"2026-08-06T15:53:06.514188Z","submitted_at":"2024-11-10T13:45:08Z","title":"Accelerating Large Language Model Training with 4D Parallelism and Memory Consumption Estimator","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.06465","snapshot_observed_at":"2026-08-07T04:20:01.748761Z","title":"Accelerating large language model training with 4d parallelism and memory consumption estimator.arXiv preprint arXiv:2411.06465,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.748761Z"},"links":{"cited_paper":"/paper/2411.06465","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:7024460ae4b083e72cbb4210b1cb48db73a532115ba420d0dc078d8f88727d64","observation_id":"6d204c69-99c5-4a21-bd5b-525ec5c9bf7f","resolution":{"observed_at":"2026-08-07T04:20:01.748761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.425659Z","title":"Multi-modal retrieval for large language model based speech recognition","venue":null,"work_id":"ebb63fc5-2d95-4852-a92d-952446316d2b","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.864939Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:5f4c8027896d70c345e30cd3e0ad82b1deff5bad5301df8967256ec0d9f34b4f","observation_id":"3e815e8f-b7d8-4f4f-a5e3-437ea48638f0","resolution":{"observed_at":"2026-08-07T04:20:05.518206Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T04:20:01.974493Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.974493Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:83f356c01facea3a6d272ebe7ae9cc7ef955d179cff7328b70406c7119d915b7","observation_id":"b01983a9-bd29-40e3-9935-155b55572131","resolution":{"observed_at":"2026-08-07T04:20:01.974493Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.272664Z","title":"Gossip learning as a decentralized alternative to federated learning","venue":null,"work_id":"f807a31a-9f60-434e-82ce-7223ae963b20","year":2019},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.148062Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:d3cd1e1485bbc53866ae50429f904ec3847139ba7ea8cde5ae539dcf3433dcf7","observation_id":"77259df9-ea19-4f21-ac1c-ae6023676458","resolution":{"observed_at":"2026-08-07T04:20:05.355092Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.01152","last_updated":"2024-12-02T05:52:32Z","snapshot_observed_at":"2026-08-05T23:27:46.512221Z","submitted_at":"2024-12-02T05:52:32Z","title":"INTELLECT-1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.01152","snapshot_observed_at":"2026-08-07T04:20:02.210179Z","title":"Intellect-1 technical report.arXiv preprint arXiv:2412.01152,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.210179Z"},"links":{"cited_paper":"/paper/2412.01152","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:d71acb197f81ba7eaad7df072ca5cfbfce00fa8f373938544de921b44931cd9e","observation_id":"3374d221-5816-47ef-83dd-ecb16684645c","resolution":{"observed_at":"2026-08-07T04:20:02.210179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12996","last_updated":"2025-02-18T16:16:14Z","snapshot_observed_at":"2026-08-07T18:07:59.737890Z","submitted_at":"2025-02-18T16:16:14Z","title":"Eager Updates For Overlapped Communication and Computation in DiLoCo","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12996","snapshot_observed_at":"2026-08-07T04:20:02.348645Z","title":"Eager updates for overlapped communication and computa- tion in diloco.arXiv preprint arXiv:2502.12996,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.348645Z"},"links":{"cited_paper":"/paper/2502.12996","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:20a00747f5c2d3316eeed59327f7f7546548427e11cf013009a27406f953bde4","observation_id":"3c9ed00b-a904-4091-89e0-3e9c0ab20b07","resolution":{"observed_at":"2026-08-07T04:20:02.348645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.03306","last_updated":"2022-08-05T17:46:38Z","snapshot_observed_at":"2026-07-06T13:39:17.572174Z","submitted_at":"2022-08-05T17:46:38Z","title":"Branch-Train-Merge: Embarrassingly Parallel Training of Expert Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.03306","snapshot_observed_at":"2026-08-07T04:20:02.441768Z","title":"Branch-train-merge: Embarrassingly parallel training of expert language models.arXiv preprint arXiv:2208.03306,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.441768Z"},"links":{"cited_paper":"/paper/2208.03306","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:0610bf4e33e8534d7965298ed862a0ffa4cd2ee166eec7f3e6abeea680f54497","observation_id":"b4b1e656-90ed-4aec-8020-cb5f269abe2c","resolution":{"observed_at":"2026-08-07T04:20:02.441768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04434","last_updated":"2024-06-19T06:04:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-07T15:56:43Z","title":"DeepSeek-V2: A Strong, Economical, and Efficient Mixture-of-Experts Language Model","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.04434","snapshot_observed_at":"2026-08-07T04:20:02.634075Z","title":"Deepseek-v2: A strong, economical, and efficient mixture-of-experts language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.634075Z"},"links":{"cited_paper":"/paper/2405.04434","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:98274203c7c24855d82519c33370e6d82197046c2a04a2327695f15d870d011f","observation_id":"10e37934-bee7-490a-a7d6-0280c0aea2cc","resolution":{"observed_at":"2026-08-07T04:20:02.634075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-07T04:20:02.772956Z","title":"Ring attention with blockwise transformers for near-infinite context","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.772956Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:9d74e16037f377a711a5b6cb2327ac36d8f9d17ff77854202cf7290e56bd7e2a","observation_id":"530c52cb-cc8e-42ee-8693-b14682ecb157","resolution":{"observed_at":"2026-08-07T04:20:02.772956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:05.078727Z","title":"Voxtlm: Unified decoder-only models for consolidating speech recognition, synthesis and speech, text continuation tasks","venue":null,"work_id":"90f95a3c-2814-48ca-a589-ffc3600926e2","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.891618Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:ab2474e2a9844c5a679d85fee6e8c5991b7ef058e04b34d43a46f2e34d08ea8d","observation_id":"a4cc0a39-b71e-4342-829e-77b1049da533","resolution":{"observed_at":"2026-08-07T04:20:05.196952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T04:20:02.977721Z","title":"Decoupled momentum optimization.arXiv preprint arXiv:2411.19870,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.977721Z"},"links":{"citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:764c77e618efa42c04641a2f2b8ee62cb3d73d3fb0f40e8757e0b298f667db24","observation_id":"aa96d7c7-d788-4ba7-87a7-e7b9fa5ab439","resolution":{"observed_at":"2026-08-07T04:20:02.977721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.12925","last_updated":"2023-06-22T14:37:54Z","snapshot_observed_at":"2026-08-07T01:18:02.068918Z","submitted_at":"2023-06-22T14:37:54Z","title":"AudioPaLM: A Large Language Model That Can Speak and Listen","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.12925","snapshot_observed_at":"2026-08-07T04:20:03.098045Z","title":"Audiopalm: A large language model that can speak and listen.arXiv preprint arXiv:2306.12925,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.098045Z"},"links":{"cited_paper":"/paper/2306.12925","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:1743ec9360d3255ae1b9df5438cb3871c4609d4ecb4f16ff9bbb7ce6de4b6081","observation_id":"95c78d5c-61c1-4da5-ab96-fd94ef911029","resolution":{"observed_at":"2026-08-07T04:20:03.098045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03488","last_updated":"2024-11-11T01:33:50Z","snapshot_observed_at":"2026-08-06T11:28:43.056681Z","submitted_at":"2024-06-05T17:50:03Z","title":"Seq1F1B: Efficient Sequence-Level Pipeline Parallelism for Large Language Model Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03488","snapshot_observed_at":"2026-08-07T04:20:03.399755Z","title":"Seq1f1b: Efficient sequence-level pipeline parallelism for large language model training.arXiv preprint arXiv:2406.03488,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.399755Z"},"links":{"cited_paper":"/paper/2406.03488","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:51a758b3e210f5915b0932c166685e559b144cfa34aa67a2da53fe7f640c7e7a","observation_id":"32e693ef-cd80-4b41-b600-8517c3f41108","resolution":{"observed_at":"2026-08-07T04:20:03.399755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-07T04:20:03.463865Z","title":"Gemini: a family of highly capable multimodal models.arXiv preprint arXiv:2312.11805,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.463865Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:e2d6a1e2ffd77dde170d025b5213ebd2ca2cde4ad522fbbd0051d9469dfa3765","observation_id":"cd3950f5-67fb-440c-b0d9-34d6f7f6243a","resolution":{"observed_at":"2026-08-07T04:20:03.463865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-07T04:20:03.596714Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.596714Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:03dd72230a7b75b2ee6db707903fbad33d24ef9e754013a7f71462b5ff698dbc","observation_id":"7bd30d2f-f0d0-4fb0-8a71-1d82af263cdc","resolution":{"observed_at":"2026-08-07T04:20:03.596714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.02021","last_updated":"2018-03-06T05:01:37Z","snapshot_observed_at":"2026-08-07T04:32:21.345259Z","submitted_at":"2018-03-06T05:01:37Z","title":"Understanding Short-Horizon Bias in Stochastic Meta-Optimization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.02021","snapshot_observed_at":"2026-08-07T04:20:03.712956Z","title":"Understanding short-horizon bias in stochastic meta- optimization.arXiv preprint arXiv:1803.02021,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.712956Z"},"links":{"cited_paper":"/paper/1803.02021","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:946f851f1f1b742eeef8e2350042676aedb1c87983433050bb32225a037bfbb3","observation_id":"acc50d72-f732-4238-9b91-c6dec2b411bf","resolution":{"observed_at":"2026-08-07T04:20:03.712956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.03895","last_updated":"2025-03-02T15:55:07Z","snapshot_observed_at":"2026-07-06T20:17:43.203959Z","submitted_at":"2025-01-07T16:03:14Z","title":"LLaVA-Mini: Efficient Image and Video Large Multimodal Models with One Vision Token","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.03895","snapshot_observed_at":"2026-08-07T04:20:03.894658Z","title":"Llava-mini: Efficient image and video large multimodal models with one vision token.arXiv preprint arXiv:2501.03895,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.894658Z"},"links":{"cited_paper":"/paper/2501.03895","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:2e79483ce0ad4adc02b11bd9692847a92a89981c2cb6d3540874a93312aeffa9","observation_id":"220f8bba-cf8e-446a-b0d3-556a1f5f6b26","resolution":{"observed_at":"2026-08-07T04:20:03.894658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-07T04:20:04.008649Z","title":"Opt: Open pre-trained transformer language models.arXiv preprint arXiv:2205.01068,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.008649Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:2dcfa5e0c886863de82e8ed205e0587c9be0c4f1d764cd6a1ff499fe37f10a23","observation_id":"690eda80-e49a-436d-882c-c9a5acbceded","resolution":{"observed_at":"2026-08-07T04:20:04.008649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.10592","snapshot_observed_at":"2026-08-07T04:20:04.131435Z","title":"Minigpt-4: Enhancing vision-language understanding with advanced large language models.arXiv preprint arXiv:2304.10592,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:04.131435Z"},"links":{"cited_paper":"/paper/2304.10592","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:67f8e38784d2ec895b0a663e837b098ffaa573e672d94b19ada7f8feb0392133","observation_id":"f07824be-df69-48a6-93ae-a5650d60d4c5","resolution":{"observed_at":"2026-08-07T04:20:04.131435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-07T04:20:03.212684Z","title":"Megatron- lm: Training multi-billion parameter language models using model parallelism.arXiv preprint arXiv:1909.08053,","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.212684Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:355b9c9ca60d95f81f9129e6c3d0d1363607ab41f02b4dcdfb8645bb43bf8ad8","observation_id":"53121814-be8b-4886-b40d-58a300d2c5a5","resolution":{"observed_at":"2026-08-07T04:20:03.212684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20215","last_updated":"2025-03-26T04:17:55Z","snapshot_observed_at":"2026-08-06T08:46:20.194739Z","submitted_at":"2025-03-26T04:17:55Z","title":"Qwen2.5-Omni Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.20215","snapshot_observed_at":"2026-08-07T04:20:03.825593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.825593Z"},"links":{"cited_paper":"/paper/2503.20215","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:1797471cc9cadae7ecfbbe8aab6427f85d21e210f197a787e167a0538ebc84d5","observation_id":"98f1ddbe-3a72-4627-8ce1-11e6c3bbf1d3","resolution":{"observed_at":"2026-08-07T04:20:03.825593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04093","last_updated":"2025-02-09T16:06:53Z","snapshot_observed_at":"2026-08-06T20:00:26.901131Z","submitted_at":"2024-08-07T21:16:55Z","title":"Tree Attention: Topology-aware Decoding for Long-Context Attention on GPU clusters","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04093","snapshot_observed_at":"2026-08-07T04:20:03.307804Z","title":"Tree attention: Topology-aware decoding for long-context attention on gpu clusters.arXiv preprint arXiv:2408.04093,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:03.307804Z"},"links":{"cited_paper":"/paper/2408.04093","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:affeb244f6f64149020b258cfb31c1b72e3cd3043948ee498f144466b342cc87","observation_id":"447711e1-fe9b-42e6-9541-dab3815cd531","resolution":{"observed_at":"2026-08-07T04:20:03.307804Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12918","last_updated":"2025-02-03T18:24:33Z","snapshot_observed_at":"2026-08-06T01:13:21.224004Z","submitted_at":"2024-10-16T18:03:52Z","title":"Boosting Asynchronous Decentralized Learning with Model Fragmentation","version":2},"cited_work":{"arxiv_id":"2410.12918","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.12918","snapshot_observed_at":"2026-08-07T04:20:04.785312Z","title":"Boosting Asynchronous Decentralized Learning with Model Fragmentation","venue":"cs.DC","work_id":"1d0344da-8895-4c80-9f0e-c6cd44149f7a","year":2024},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:00.935672Z"},"links":{"cited_paper":"/paper/2410.12918","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:2f82287a18bf38a4d44cb2e8c416db24abf59969c3bb0c8cfd8181b56b39750a","observation_id":"55ee83f6-9f03-4f0c-a4d7-a8b5b4219cc9","resolution":{"observed_at":"2026-08-07T04:20:04.862629Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08105","last_updated":"2024-09-23T10:41:27Z","snapshot_observed_at":"2026-08-04T10:53:01.395272Z","submitted_at":"2023-11-14T12:05:45Z","title":"DiLoCo: Distributed Low-Communication Training of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08105","snapshot_observed_at":"2026-08-07T04:20:01.338312Z","title":"Diloco: Distributed low-communication training of language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.338312Z"},"links":{"cited_paper":"/paper/2311.08105","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:4213be8aa370fba51e567f65002c78c2a378daa3872cd677fd409e5682b8b763","observation_id":"407c224f-5d82-43e0-9a22-a0ba775b36cf","resolution":{"observed_at":"2026-08-07T04:20:01.338312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.10122","last_updated":"2024-10-01T12:07:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-16T10:59:44Z","title":"Video-LLaVA: Learning United Visual Representation by Alignment Before Projection","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.10122","snapshot_observed_at":"2026-08-07T04:20:02.518775Z","title":"Video-llava: Learning united visual representation by alignment before projection.arXiv preprint arXiv:2311.10122,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:02.518775Z"},"links":{"cited_paper":"/paper/2311.10122","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:66c0c47b99d24c59a6247c937e46203d84e6c8d5aa15ebd1633b9dfee0d3abf6","observation_id":"1faccbb5-2426-49f5-9ba6-a16d4417fef3","resolution":{"observed_at":"2026-08-07T04:20:02.518775Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10616","last_updated":"2024-03-15T18:26:51Z","snapshot_observed_at":"2026-07-06T17:45:27.526239Z","submitted_at":"2024-03-15T18:26:51Z","title":"DiPaCo: Distributed Path Composition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10616","snapshot_observed_at":"2026-08-07T04:20:01.483869Z","title":"Dipaco: Distributed path composition.arXiv preprint arXiv:2403.10616,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.483869Z"},"links":{"cited_paper":"/paper/2403.10616","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:8ed37b572b5439046cff2e243033824d89ac9ddbee15495ac38387b61ca8905d","observation_id":"4d229f63-2d0b-43a6-bd9c-1b00d23b3a15","resolution":{"observed_at":"2026-08-07T04:20:01.483869Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06204","last_updated":"2025-04-09T13:54:59Z","snapshot_observed_at":"2026-08-07T19:39:57.333135Z","submitted_at":"2024-06-26T16:34:33Z","title":"A Survey on Mixture of Experts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06204","snapshot_observed_at":"2026-08-07T04:20:01.009446Z","title":"A survey on mixture of experts","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.009446Z"},"links":{"cited_paper":"/paper/2407.06204","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:d717865587f5101af37459c26a26796c39058a054030053c38b592d10b3212a7","observation_id":"280f9081-1285-4bea-b77f-4aa7a991a3ec","resolution":{"observed_at":"2026-08-07T04:20:01.009446Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08758","last_updated":"2021-09-30T17:20:01Z","snapshot_observed_at":"2026-08-03T11:31:09.198404Z","submitted_at":"2021-04-18T07:42:52Z","title":"Documenting Large Webtext Corpora: A Case Study on the Colossal Clean Crawled Corpus","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08758","snapshot_observed_at":"2026-08-07T04:20:01.226611Z","title":"Documenting large webtext corpora: A case study on the colossal clean crawled corpus","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T04:20:01.226611Z"},"links":{"cited_paper":"/paper/2104.08758","citing_paper":"/paper/2506.10911"},"observation_digest":"sha256:aadd4b459b6c5038b137d46d72cb4c0a241aa1a7b60a484206934bf0d0196737","observation_id":"a13ce9fc-8aa6-4add-9d92-7032a549a2ea","resolution":{"observed_at":"2026-08-07T04:20:01.226611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.10911","last_updated":"2025-06-12T17:23:23Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T10:22:28.701636Z","submitted_at":"2025-06-12T17:23:23Z","title":"NoLoCo: No-all-reduce Low Communication Training Method for Large Models"},"reference_resolution":{"displayed":31,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":1,"verified_fuzzy":3},"total_outbound_references":31},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 31 of 31 outbound references and 5 inbound Pith citation observations for arXiv:2506.10911."}