{"as_of":"2026-08-08T02:54:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8ea6e998fa0462dac0696f3fcafe1c7967f95295d3b6c73b4a95d158c0d4af66","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T14:02:51.437970Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.20225/citation-record","integrity":"/paper/2505.20225/integrity","json":"/paper/2505.20225/citation-record.json","paper":"/paper/2505.20225"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2409.11423","last_updated":"2025-01-29T18:27:16Z","snapshot_observed_at":"2026-08-06T18:54:30.797471Z","submitted_at":"2024-09-12T10:14:12Z","title":"Generated Data with Fake Privacy: Hidden Dangers of Fine-tuning Large Language Models on Generated Data","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.11423","snapshot_observed_at":"2026-08-07T14:02:44.098280Z","title":"Generated data with fake privacy: Hidden dangers of fine-tuning large language models on generated data","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.098280Z"},"links":{"cited_paper":"/paper/2409.11423","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:9ecc7a1481644e4349d09c71d4a1317df04e0f5a46d2faf5900a24599b1d78e8","observation_id":"8f7cb68c-c85a-429a-b05b-0f20b46cd02f","resolution":{"observed_at":"2026-08-07T14:02:44.098280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:44.185028Z","title":"Emergent and predictable memorization in large language models.Advances in Neural Information Processing Systems, 36:28072–28090, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.185028Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:cb7d5d370342124b58b9703da437532208f51d0081c95490299194b6d4744701","observation_id":"c9399a12-234f-4d58-953b-785a7351a57b","resolution":{"observed_at":"2026-08-07T14:02:44.185028Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.241633Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"40573ded-35db-4872-a7a1-5ff07e20ae17","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.270403Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:7ad16a519d95b0b3bc89095206b9a90cc1549b3bbc773dc6a1ec7ae4392436d9","observation_id":"b1066643-3fa7-4900-bf49-dd1df442b687","resolution":{"observed_at":"2026-08-07T14:02:57.347994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:57.087358Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d3943071-9343-4007-8546-3b90cba75fae","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.386672Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:d78342bf73a338c156ef77c7a1eda3daaa3da9687dfaa3c073ddc00f8f03c0d9","observation_id":"19b5c372-8288-4763-b652-6a08202985e1","resolution":{"observed_at":"2026-08-07T14:02:57.131655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.804318Z","title":"On the representation collapse of sparse mixture of experts.Proc","venue":null,"work_id":"32003497-9f73-43cb-b683-655a94ea3b50","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.465623Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:12f60b151777c7468e1bacbbe92162a13a058e70044b5a68e288f5a63b6c53cb","observation_id":"4cc5e103-b3f9-402d-a872-6b5f11822cc6","resolution":{"observed_at":"2026-08-07T14:02:56.991684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.612033Z","title":"Think you have solved question answering? Try ARC, the ai2 reasoning challenge.ArXiv preprint, 2018","venue":null,"work_id":"498fba82-3d87-41bc-b5dd-fb01bb5214aa","year":2018},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.535555Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:6cdfef9857c08a6886e6d38e6fce932231045fd691b8530a6c7a27a9c89c4ede","observation_id":"17867122-d6c0-4dd7-a013-08ec8d2efbcf","resolution":{"observed_at":"2026-08-07T14:02:56.694982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:44.870448Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.JMLR, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:44.870448Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:998b03431fc6a5bbabcd8f2769ed19bd344ba24135a4d7cf4837cf2b5c5e4113","observation_id":"979caedc-952a-44ab-8c32-168840215b12","resolution":{"observed_at":"2026-08-07T14:02:44.870448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:46.280209Z","title":"A framework for few-shot language model evaluation, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.280209Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ed690b55ae2eb5b2809fbf0c3d3ae0c580573a06ebb8f328bee620e760875a57","observation_id":"ce109ed3-19b0-4f5f-8f44-e4aa15571a9f","resolution":{"observed_at":"2026-08-07T14:02:46.280209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.394827Z","title":"Fastmoe: A fast mixture-of-expert training system.ArXiv preprint, 2021","venue":null,"work_id":"40b398fd-9afd-43c2-851a-5e363289819b","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:46.500738Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:1a5f5623bcc8c8d76b888d20a9689e43c717b379e7b6bce688e3b92d7a953d7c","observation_id":"0260bff8-ab34-40aa-a0e4-839c568c536f","resolution":{"observed_at":"2026-08-07T14:02:56.459809Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.220245Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":"888774d2-cac0-4e4c-9384-af851cf57273","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:47.956423Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:e8118c91b24f10c87e34569d00f8f1fd5d09f026137e95c1ac14246a1eb33a96","observation_id":"837e542e-4add-4452-860f-13db535962b7","resolution":{"observed_at":"2026-08-07T14:02:56.294055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:56.023680Z","title":"Rae, and Laurent Sifre","venue":null,"work_id":"05e7ad28-cf2e-4ad4-838f-acb9ab974322","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.421407Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:df59bec0ac814eceeff5a8f0dcb534523823198cc7c13eb32a7bf1395014042f","observation_id":"2a02d5d3-a089-44f8-a061-99e75156a5d4","resolution":{"observed_at":"2026-08-07T14:02:56.108386Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.902183Z","title":"MiniCPM: Unveiling the potential of small language models with scalable training strategies.ArXiv preprint, 2024","venue":null,"work_id":"d000ab04-590b-4dba-801c-d3f020cb5523","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.559340Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:aad0adbcfeeda458d82387a260be7c03634b0a48af5f6b13aab2e796bb0f50c0","observation_id":"1ec5f9de-fb94-47fb-8161-ede4a9723c2c","resolution":{"observed_at":"2026-08-07T14:02:55.955220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.17817","last_updated":"2024-07-25T07:10:31Z","snapshot_observed_at":"2026-07-06T18:51:41.167282Z","submitted_at":"2024-07-25T07:10:31Z","title":"Demystifying Verbatim Memorization in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.17817","snapshot_observed_at":"2026-08-07T14:02:48.631328Z","title":"Demystifying verbatim memorization in large language models.arXiv preprint arXiv:2407.17817, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.631328Z"},"links":{"cited_paper":"/paper/2407.17817","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:0293321ef9cc6a441bef87cb6bfef9e06818d60dccd4c5f1c4ac02280c406f86","observation_id":"4d514ff9-0f8f-4d37-909c-3756780d7cc0","resolution":{"observed_at":"2026-08-07T14:02:48.631328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.701963Z","title":"Tutel: Adaptive mixture-of-experts at scale.Proc","venue":null,"work_id":"88a350f6-6d2d-42fb-83dd-b2f4a9063128","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.696471Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:d4e4a1b56e28bd8eef2e7acce258790a0fab4738fe35efb787663feebb7134a0","observation_id":"9cf0d8ca-ff43-48f7-8858-1af889e32b07","resolution":{"observed_at":"2026-08-07T14:02:55.778999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.571510Z","title":"Mixtral of experts.ArXiv preprint, 2024","venue":null,"work_id":"2819a51f-f91e-4d15-8b46-f8bdecd0af09","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.774085Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:2992e422d21760031c91df11f40c6575068585157709ffc854c2cf2d600894ba","observation_id":"7836f992-70e3-44e5-96aa-b364a4855eee","resolution":{"observed_at":"2026-08-07T14:02:55.645820Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:48.903883Z","title":"Kingma and Jimmy Ba","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.903883Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:1905c48a5feb7ed3a59c388d281a66ea24532c11730d848330b52f5c1e634c73","observation_id":"600cf498-58d5-4668-a673-ceed6b75624c","resolution":{"observed_at":"2026-08-07T14:02:48.903883Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.424491Z","title":"Gshard: Scaling giant models with condi- tional computation and automatic sharding.ArXiv preprint, 2020","venue":null,"work_id":"d694e986-a03f-45d0-bd2f-02753fccf9fb","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:48.998050Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:eb4b0b62c955c02c7c6bdad206df19b64bac4a8dae79cee95006099d768bf3e6","observation_id":"91fb215e-94c9-4a4a-ba68-68fac46da7b2","resolution":{"observed_at":"2026-08-07T14:02:55.494798Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.226141Z","title":"Base layers: Simplifying training of large, sparse models","venue":null,"work_id":"6ca20a19-edd0-453d-be66-4691046dac66","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.095709Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:6f38971c17ff71ed34f41b34b32cb32c3a75596aeca2b47705710663890511e5","observation_id":"57be5bee-4181-4a08-a047-9b862dc2c2d6","resolution":{"observed_at":"2026-08-07T14:02:55.322288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:55.001578Z","title":"DataComp-LM: In search of the next generation of training sets for language models","venue":null,"work_id":"a1874a21-d421-4a24-9704-bd209e497e1a","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.225017Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:d2b0278e937bc19fc749b5707b726842dbb987d26fd057f590615e49bca9b975","observation_id":"32991eed-24c1-4f1d-8a80-38227fbea49e","resolution":{"observed_at":"2026-08-07T14:02:55.097841Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.813496Z","title":"DeepSeek-V2: A strong, economical, and efficient mixture-of-experts language model.ArXiv preprint, 2024","venue":null,"work_id":"71bca25b-89e1-4e37-87fe-a19caccfcbda","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.299350Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:3087c2d18587af9e2c163a7c80c63bbc769f83fd91b25b4614fbb0940d5cb6dc","observation_id":"205aaada-f018-4f97-8661-88b85581ae3c","resolution":{"observed_at":"2026-08-07T14:02:54.915523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.619886Z","title":"Deepseek-v3 technical report.ArXiv preprint, 2024","venue":null,"work_id":"49268f7b-eb6d-4841-9463-6012d267e859","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.376132Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:7e229a04e2327fa84a67ff11de32fef919a589ce382f68743b5648068326d258","observation_id":"2488fdc3-327d-4a77-a490-b7155880a952","resolution":{"observed_at":"2026-08-07T14:02:54.699463Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.11451","last_updated":"2024-10-15T09:57:19Z","snapshot_observed_at":"2026-07-06T19:33:43.723135Z","submitted_at":"2024-10-15T09:57:19Z","title":"Tending Towards Stability: Convergence Challenges in Small Language Models","version":1},"cited_work":{"arxiv_id":"2410.11451","doi":null,"metadata_source":"pith","pith_arxiv_id":"2410.11451","snapshot_observed_at":"2026-08-07T14:02:51.859512Z","title":"Tending Towards Stability: Convergence Challenges in Small Language Models","venue":"cs.CL","work_id":"f32fe5d7-6859-465a-acee-1f58f36de26f","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.501554Z"},"links":{"cited_paper":"/paper/2410.11451","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:87e7d3a767d301d8f41a1e1f3d3590353e12bcae8036d5cc6277c3d4ba42d17e","observation_id":"c893d78f-3ea9-4cd1-bfd2-30062ab246b4","resolution":{"observed_at":"2026-08-07T14:02:51.956017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:49.622260Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.622260Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:e051463bcd7088bde524941d35ca327250cfacc81e045452626baf11aa73e1dd","observation_id":"347390f4-ba5f-4991-9f2d-07015a526b31","resolution":{"observed_at":"2026-08-07T14:02:49.622260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.444758Z","title":"Can a suit of armor conduct electricity? A new dataset for open book question answering","venue":null,"work_id":"c7ad1765-d33b-4cf6-9540-c57c9e225761","year":2018},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.725393Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:61cabb354be50fe3199775be3bc8790f912dac1ef6fefbb4dc97d5b230957be1","observation_id":"377c94ac-495e-4e96-84f2-1f3ca751b85a","resolution":{"observed_at":"2026-08-07T14:02:54.543552Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.287202Z","title":"OLMoE: Open mixture-of- experts language models","venue":null,"work_id":"b16b1554-910b-4ad0-b422-1730eb625648","year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.831717Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:8bc1af15f13aa524488230d4924fef490f9e56c02c2dc05f7386c05c872779bd","observation_id":"2e3005a9-6025-4c94-977a-647799d1facc","resolution":{"observed_at":"2026-08-07T14:02:54.352140Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:54.118130Z","title":"Attributing mode collapse in the fine-tuning of large language models","venue":null,"work_id":"abc74e5a-2626-460a-a9aa-97141d1f57a2","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:49.925737Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:86e32b31a4d8dfd97de9303b853e137b7917c1959bc80dc960af89ea6db97b4a","observation_id":"42cb3bec-3ff6-43e2-9c9d-19449809682d","resolution":{"observed_at":"2026-08-07T14:02:54.222040Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.957697Z","title":"Deepspeed-moe: Advancing mixture-of- experts inference and training to power next-generation ai scale","venue":null,"work_id":"0689a02d-0098-476a-9f5e-f0d05ea04809","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.016518Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:2d8f1f2c28cc5b91a0c4b4a1544cd0539af891086c642e0981e0262b21f0ac6c","observation_id":"59ccef2d-e88b-4f1f-b0ff-247c8dcb8098","resolution":{"observed_at":"2026-08-07T14:02:54.005119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.766457Z","title":"Winogrande: An adversarial winograd schema challenge at scale","venue":null,"work_id":"224727b1-e825-4d1b-bf69-8f094ece57f9","year":2020},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.132350Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:0b144f2b6dcdc21feba12c0d564cf4683e5fcb49fea2cccc5fb815910b55794c","observation_id":"9049d2e6-f188-4158-a940-595c4b82c435","resolution":{"observed_at":"2026-08-07T14:02:53.845348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.586332Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.ArXiv preprint, 2017","venue":null,"work_id":"96bf0dfb-54e4-477a-a50b-f208f45859b4","year":2017},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.256613Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:ac806a226e4f78aa721d6a8a464cf0e8379b9d2645b6eab2b0bdd83f55d86167","observation_id":"ee80a897-dbc9-4f7e-8163-6394dfc5ff60","resolution":{"observed_at":"2026-08-07T14:02:53.671642Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.407221Z","title":"JetMoE: Reaching llama2 performance with 0.1 m dollars.ArXiv preprint, 2024","venue":null,"work_id":"7ad45679-ca9a-4cbb-9108-59e0b15515fb","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.353681Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:230c2c973228d2ab59f297056f4e52e5c193491e86f450459c15b20fa212f5c8","observation_id":"604aefab-5833-440f-b97d-1813b83ca0a6","resolution":{"observed_at":"2026-08-07T14:02:53.496149Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.249425Z","title":"Megatron-lm: Training multi-billion parameter language models using model parallelism.ArXiv preprint, 2019","venue":null,"work_id":"bd344268-15fe-49df-aeac-c778f9f480c3","year":2019},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.455008Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:6234f64819cf4b7663f7fb2b92ed37c3e1fe945ae399bcfcb48b164f3ed63295","observation_id":"1fc7123e-646d-4393-8b86-6fab5e0cb37f","resolution":{"observed_at":"2026-08-07T14:02:53.348965Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.02013","last_updated":"2025-06-15T18:27:17Z","snapshot_observed_at":"2026-08-01T16:50:50.645857Z","submitted_at":"2025-02-04T05:03:42Z","title":"Layer by Layer: Uncovering Hidden Representations in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.02013","snapshot_observed_at":"2026-08-07T14:02:50.561305Z","title":"Layer by layer: Uncovering hidden representations in language models.arXiv preprint arXiv:2502.02013, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.561305Z"},"links":{"cited_paper":"/paper/2502.02013","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:5a51b95efdd7e37d976feb395ede6aded0f1563b9120225fde895781fafdc7b3","observation_id":"3b62554e-adc6-4893-8488-a990ba9a1b9b","resolution":{"observed_at":"2026-08-07T14:02:50.561305Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:53.083757Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"631e4d81-cea5-4460-b86c-d1e8de32ee91","year":2023},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.679920Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:fadc28fccec11bdcd3e2f2621ed27054564026665ae29dcbb84ef908fecc3df2","observation_id":"59facc6e-3fac-4b6c-90c8-1093272969e9","resolution":{"observed_at":"2026-08-07T14:02:53.158449Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.890519Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context.ArXiv preprint, 2024","venue":null,"work_id":"b47bdf9f-e52f-4019-9ab7-af93833b5fe0","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.778370Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:e7f7db31c58f89212a82fd00da012019fdab791a597eda935861ca3d6ae29596","observation_id":"b53b6c84-44e8-4434-9e21-a2ac9b6741f3","resolution":{"observed_at":"2026-08-07T14:02:52.961360Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10827","last_updated":"2024-11-25T20:04:58Z","snapshot_observed_at":"2026-08-07T22:47:53.569965Z","submitted_at":"2024-07-15T15:38:51Z","title":"LLM Circuit Analyses Are Consistent Across Training and Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10827","snapshot_observed_at":"2026-08-07T14:02:50.878275Z","title":"Llm circuit analyses are consistent across training and scale.arXiv preprint arXiv:2407.10827, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:50.878275Z"},"links":{"cited_paper":"/paper/2407.10827","citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:349268b0f8474738cdb11bad8a7ae5c2a9c0aaecb8cf3abb179f8aafd1aad042","observation_id":"675da49c-9505-4b43-86d1-2942a9db9fec","resolution":{"observed_at":"2026-08-07T14:02:50.878275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.687094Z","title":"OpenMoE: An early effort on open mixture-of-experts language models.ArXiv preprint, 2024","venue":null,"work_id":"20374ff6-531e-4e5f-94c5-6654c8895640","year":2024},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.005458Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:6b977590e02e72fc6e2fd1998f2967b2b7ca78b5a7c1ee8e3399f7c42d5cda73","observation_id":"7797fdd4-71a3-47c6-ab3e-5ba497646968","resolution":{"observed_at":"2026-08-07T14:02:52.797912Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.494417Z","title":"M6-T: Exploring sparse expert models and beyond.arXiv preprint, 2021","venue":null,"work_id":"545d3eaf-72f2-41fd-bd78-b04b9dff3f7a","year":2021},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.127391Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:05d7530f7fa70d4c06cace9f57318386a2688a16663adbb81aa5b5d4057e2e04","observation_id":"236e214e-2813-4c4f-a6d9-7e262475f5f7","resolution":{"observed_at":"2026-08-07T14:02:52.594448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.331953Z","title":"HellaSwag: Can a machine really finish your sentence? InProc","venue":null,"work_id":"57bed504-b6a1-4b14-8252-523a433d6a37","year":2019},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.236526Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:bf0cbc1f8d5f6d7612f8567122fd4eeee1a0b4ddc92b5882dd85e0c4388da54e","observation_id":"8fb563fd-cd57-47fa-8787-b1992250163a","resolution":{"observed_at":"2026-08-07T14:02:52.401440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:52.108050Z","title":"OPT: Open pre-trained transformer language models.ArXiv preprint, 2022","venue":null,"work_id":"b186d629-91cb-4a30-841c-0e27a5cfc53c","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.365700Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:26c7c2cae5fc2ccf224b7f064b423dff7810932ef88c09453b7ca4ac481b6d0f","observation_id":"7475c41a-9ede-430d-bf65-5afe0a0e104e","resolution":{"observed_at":"2026-08-07T14:02:52.220119Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9017.37247","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T14:02:51.654044Z","title":"ST-MoE: Designing stable and transferable sparse expert models.ArXiv preprint, 2022","venue":null,"work_id":"7a9f60c3-fc4a-4dd0-96f1-d3c82761eff0","year":2022},"citing_paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T14:02:51.437970Z"},"links":{"citing_paper":"/paper/2505.20225"},"observation_digest":"sha256:0e3fb12d922bee0fcabf1425a59730f3f86ca8a44e70c853ff98e089f116c205","observation_id":"846f8683-413e-4ca0-842b-a049c33d399f","resolution":{"observed_at":"2026-08-07T14:02:51.728312Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.20225","last_updated":"2025-05-26T17:06:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T22:49:13.375672Z","submitted_at":"2025-05-26T17:06:25Z","title":"FLAME-MoE: A Transparent End-to-End Research Platform for Mixture-of-Experts Language Models"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":9,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2505.20225."}