{"as_of":"2026-08-11T09:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:cc08f1cf4c421430c65044924de535bc30cabe8f03d7a58d337133cd3655053a","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-30T13:22:40.017922Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2605.24681/citation-record","integrity":"/paper/2605.24681/integrity","json":"/paper/2605.24681/citation-record.json","paper":"/paper/2605.24681"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.701099Z","title":"Multilingual mix: Example interpolation improves multilingual neural machine translation,","venue":null,"work_id":"c7754d7b-d8d6-415b-84d1-90d7de26bb46","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:55d5caf05a86574df59650ddf0fcfb5f996a274eeeda2965babc778aa7711242","observation_id":"0c468522-896f-4dc7-83d3-e88935379fde","resolution":{"observed_at":"2026-07-09T02:15:55.702346Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.706693Z","title":"Towards higher pareto frontier in multilingual machine translation,","venue":null,"work_id":"79f83887-d636-4e60-bd1b-b8cb603fcc03","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:31f24364d284f6a1aabb802b0233d7f067d2a4afc467929644e04770c50c485b","observation_id":"c2f4e7ea-6ea4-4cf1-b685-54700ac7fd85","resolution":{"observed_at":"2026-07-09T02:15:55.708005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.719615Z","title":"Neural machine translation by jointly learning to align and translate,","venue":null,"work_id":"0fc2b89d-0013-4b92-98de-6c87c6d8fba3","year":2015},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:fd16697b4aed719e82e4d5ea62d144dab346ca32c51b2e7922e03bce28e085c2","observation_id":"4d52d4fb-cd7e-43c9-86d3-297b3599e121","resolution":{"observed_at":"2026-07-09T02:15:55.724660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01181","last_updated":"2024-04-02T01:56:56Z","snapshot_observed_at":"2026-08-10T07:40:35.263746Z","submitted_at":"2023-05-02T03:27:27Z","title":"A Paradigm Shift: The Future of Machine Translation Lies with Large Language Models","version":3},"cited_work":{"arxiv_id":"2305.01181","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.01181","snapshot_observed_at":"2026-06-30T13:24:40.051331Z","title":"New trends in machine translation using large language models: Case examples with chatgpt,","venue":null,"work_id":"66d63d6a-6d37-41fb-aa7b-0f9fa48e70bf","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2305.01181","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:45149bca25f624af28baaf43cb9c66f1381d4fbf0711347b5580eb7d58cd1833","observation_id":"86d73fc4-849a-416d-bc47-1d3a9a389b4d","resolution":{"observed_at":"2026-06-30T13:24:40.052918Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.758595Z","title":"Multilingual machine translation with large language models: Empirical results and analysis,","venue":null,"work_id":"2f237d43-7c3f-46d2-846c-559f6341568b","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:953199bbadf1e639c4b66edc3aa72511d41b2ff53f3ecc69b5d34275d84e8530","observation_id":"a8bdbb2f-6e1b-445b-863d-fe089945ecb1","resolution":{"observed_at":"2026-07-09T02:15:55.760100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.691821Z","title":"Revolutionising translation with ai: Unravelling neural machine translation and generative pre-trained large language models,","venue":null,"work_id":"5a482386-fc73-41fb-bb68-0e44eadf7f41","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:42253764e621247b20c745eee6b17e1de49f40cde407fc29f168257db3ca2422","observation_id":"11a5d4af-1f2c-44c0-b7a4-4917809711a2","resolution":{"observed_at":"2026-07-09T02:15:55.693154Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.690063Z","title":"Continual learning with semi-supervised contrastive distillation for incremental neural machine translation,","venue":null,"work_id":"36788643-d0bc-48bc-8a21-092fcdaf971c","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:48ee4c83091bce35d093242ae88e445e81c4e4f1bc19aa3e82a00a696f05adfc","observation_id":"03915e2e-6e39-442f-a504-4867067db930","resolution":{"observed_at":"2026-07-09T02:15:55.691265Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.08747","last_updated":"2025-01-05T04:09:00Z","snapshot_observed_at":"2026-08-10T01:52:30.559515Z","submitted_at":"2023-08-17T02:53:23Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","version":5},"cited_work":{"arxiv_id":"2308.08747","doi":"10.48550/arxiv.2308.08747","metadata_source":"pith","pith_arxiv_id":"2308.08747","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"An Empirical Study of Catastrophic Forgetting in Large Language Models During Continual Fine-tuning","venue":"cs.CL","work_id":"3e52a549-8994-4fc0-921b-ae16d32f1acc","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2308.08747","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:137a088f97ffdd726dd9db7ba6549269a033249e34fb9bb21131644ec8111580","observation_id":"6c9c10a7-2c89-4329-a2f6-e7c5a5253ebb","resolution":{"observed_at":"2026-06-30T13:24:40.057926Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.693762Z","title":"Simple and scalable strategies to continually pre-train large language models,","venue":null,"work_id":"bf74ee6f-1815-4056-b699-8ac9a48cf3cc","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:5d6f7950389077804286d86499b54a668f1859ed8444f16f21cc27ea191b0c80","observation_id":"9e7cf721-bffd-42e9-8fbd-9ff1c1eb2d65","resolution":{"observed_at":"2026-07-09T02:15:55.694956Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.695537Z","title":"Breaking the script barrier in multilingual pre-trained language models with transliteration-based post- training alignment,","venue":null,"work_id":"7d56c420-8fc8-40d8-a45b-be8b76832362","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:de754ed61de78fb7cd8a406d3a28c389fb5bc9917a5e3e343d167edbc7fe2234","observation_id":"f9563875-34c0-47d8-a256-a29fe363d2cd","resolution":{"observed_at":"2026-07-09T02:15:55.696817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.18311","last_updated":"2025-09-02T13:28:42Z","snapshot_observed_at":"2026-08-10T17:38:19.061722Z","submitted_at":"2024-04-28T20:44:53Z","title":"Towards Incremental Learning in Large Language Models: A Critical Review","version":5},"cited_work":{"arxiv_id":"2404.18311","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.18311","snapshot_observed_at":"2026-06-30T13:24:40.027571Z","title":"Towards incremental learning in large language models: A critical review,","venue":null,"work_id":"14d67993-0ea7-4225-be49-7dca8e8de751","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2404.18311","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:a68f2bdd59f014f87f2f7c9ccddaab87dbc8c84a153381f1cc73138fa3d5b62b","observation_id":"b3d51a11-47be-498a-bd35-ef25ce5b80ea","resolution":{"observed_at":"2026-06-30T13:24:40.028942Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.11396","last_updated":"2024-08-21T07:43:49Z","snapshot_observed_at":"2026-08-05T15:42:06.052426Z","submitted_at":"2024-08-21T07:43:49Z","title":"MoE-LPR: Multilingual Extension of Large Language Models through Mixture-of-Experts with Language Priors Routing","version":1},"cited_work":{"arxiv_id":"2408.11396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2408.11396","snapshot_observed_at":"2026-06-30T13:24:40.063901Z","title":"Moe-lpr: Multilingual extension of large language models through mixture-of-experts with language priors routing,","venue":null,"work_id":"dbaa0df1-b773-4bf4-b04c-bcd36b6e17ca","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2408.11396","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:9663fd2d159ef2281f68f9aa46350e91ec41092433c63fd304f900c9bb4056e7","observation_id":"58e7acd9-9b86-44f3-b3a1-1ddc654cc474","resolution":{"observed_at":"2026-06-30T13:24:40.065937Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.774931Z","title":"Overcoming language barriers via machine translation with sparse mixture-of-experts fusion of large language models,","venue":null,"work_id":"52cc24ac-0d69-4003-bce0-1630b032f8ef","year":2025},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:b2c82a3e47bda4a954966c40b64ff9f9a7d3fb4774572153ecca6b7275531a90","observation_id":"f4339d35-43a1-4d1f-b98f-838af3c084e3","resolution":{"observed_at":"2026-07-09T02:15:55.776476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.779347Z","title":"Attention is all you need,","venue":null,"work_id":"09470a7f-9fff-4102-ba2f-6c91bbb91954","year":2017},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:a34969a62ce66580d80f55574003136d6ed64d2681135a4d919e2789657498f6","observation_id":"3ae5b5bd-0fe7-4a8d-b6bc-83674a3b481c","resolution":{"observed_at":"2026-07-09T02:15:55.780681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.764945Z","title":"Transfer learning for low- resource neural machine translation,","venue":null,"work_id":"33641718-174f-4269-b95e-6c91d48f5c3b","year":2016},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:199bd4a11a333dab4aa531134a8d76cc08634d1604237ce5c0f7a74a3e337017","observation_id":"d7593095-0001-459c-ab45-0e57c93f5cba","resolution":{"observed_at":"2026-07-09T02:15:55.766224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.766835Z","title":"Rapid adaptation of neural machine translation to new languages,","venue":null,"work_id":"9ebab620-03bd-4611-8dd9-545c1614a860","year":2018},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:386da8722292fdc60b845428a226060fe7b3f35a7d63aaadfd58aa2ca682a9af","observation_id":"6d6f100e-a24e-4b5b-a0a6-dc9ee4e73fa0","resolution":{"observed_at":"2026-07-09T02:15:55.768079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.768667Z","title":"Improving neural machine translation models with monolingual data,","venue":null,"work_id":"a42849a3-ed2b-4176-be45-d5ed92b02461","year":2016},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:bd0eb3c038d62cda685f1930d0632599c826f1453e59609e36b3e8b0265ee26d","observation_id":"630ac5f5-831e-4235-80ed-1b291be12edf","resolution":{"observed_at":"2026-07-09T02:15:55.770100Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.770779Z","title":"Zero-shot cross-lingual transfer of neural machine translation with multilingual pretrained encoders,","venue":null,"work_id":"ac0234ec-698e-4c6a-a92e-693dcb63454f","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:91d2f6de9426c7ddbf11bb0a0eddb709129f3a058851bcf66844fb87319fe08d","observation_id":"7904255b-418b-40a3-944d-c572cd8fe4ff","resolution":{"observed_at":"2026-07-09T02:15:55.772219Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.760798Z","title":"Towards robust in-context learning for machine translation with large language models,","venue":null,"work_id":"a4675e53-9df5-4337-9ddb-824d684d4657","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:dbcdd9ca0be15f96a31f1fb5b91c0c5345f2722a59d9574f2b546edc5cb1d13f","observation_id":"b3235f91-e97d-4073-94c1-d900656e2cad","resolution":{"observed_at":"2026-07-09T02:15:55.762290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.02431","last_updated":"2024-04-03T03:37:22Z","snapshot_observed_at":"2026-08-10T03:21:19.900601Z","submitted_at":"2024-04-03T03:37:22Z","title":"On the Multilingual Ability of Decoder-based Pre-trained Language Models: Finding and Controlling Language-Specific Neurons","version":1},"cited_work":{"arxiv_id":"2404.02431","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2404.02431","snapshot_observed_at":"2026-06-30T13:24:40.061299Z","title":"Kojima, I","venue":null,"work_id":"28e0de62-5155-4fa8-835a-b3a560cd1faf","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2404.02431","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:196c80094fabeeb7f4350f02d85878826b7cfc17e9e8136a0711812f82f4ef2e","observation_id":"3c35c5e7-2901-4c81-bc4a-6765cf4eec45","resolution":{"observed_at":"2026-06-30T13:24:40.062828Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.762984Z","title":"A paradigm shift: The future of machine translation lies with large language models,","venue":null,"work_id":"f1120b22-6a51-4773-88e9-89daa3c2b63a","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:1cd17abc8fef5209595000ef11d0540dcac477953c8528f4d074a7676acbc65f","observation_id":"3daf12aa-f28d-4ff7-8ae1-af5956447efb","resolution":{"observed_at":"2026-07-09T02:15:55.764367Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.772914Z","title":"Improving translation of out of vocabulary words using bilingual lexicon induction in low-resource machine translation,","venue":null,"work_id":"a75c4561-5428-47c9-b1ed-eb5e82aca628","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:576972bdddfe479072b778d6c3ca6c818d1eeda0d5899274b61005908023d917","observation_id":"4fc343b9-c714-47cf-8f4d-59719ad2eecb","resolution":{"observed_at":"2026-07-09T02:15:55.774256Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2412.19522","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:24:40.062636Z","title":"Exploiting domain-specific par- allel data on multilingual language models for low-resource language translation,","venue":null,"work_id":"a2effba6-f344-42d9-be01-36040620b4a3","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:2caaab3e8f23013af6dbc42eaee0763cb405cea0484c5cf080ed1c0b8d651ea1","observation_id":"4c7372dc-ca19-4be7-9b12-ea7ed3bfe8aa","resolution":{"observed_at":"2026-06-30T13:24:40.064123Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.777156Z","title":"Catastrophic interference in reinforcement learning: A solution based on context division and knowledge distillation,","venue":null,"work_id":"f0fd5bcf-3c14-478d-963e-d83a04ffd680","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:09d1fe6d3f012ef7e2cfed4ed35240591e8cdccc526127ce0649c72ffecfa527","observation_id":"de0c6c74-c21a-4b4e-8ea1-a1699d7c7e57","resolution":{"observed_at":"2026-07-09T02:15:55.778655Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.783493Z","title":"Understanding catas- trophic forgetting in language models via implicit inference,","venue":null,"work_id":"ad80728d-3c81-455d-b102-514f2e9dc5dd","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:acfffe4d7c136fb64be45cf03e3d0b1237bb6b8ff01a43c085e40fce3078e368","observation_id":"f8d3c9d9-e3e5-4933-9356-f7a036571bb8","resolution":{"observed_at":"2026-07-09T02:15:55.784937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.752161Z","title":"Efficient continual pre-training for building domain specific large language models,","venue":null,"work_id":"197f6dec-3421-490d-91a7-5dff19a21aa8","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:585df12d3f5f4f02dbf0cda520842913f58e7bc2a15958e8e9c3a4aa329aeb7e","observation_id":"9c50d113-166d-4950-a107-2d1b92021140","resolution":{"observed_at":"2026-07-09T02:15:55.753506Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.754081Z","title":"Overcoming catastrophic forgetting in graph neural networks,","venue":null,"work_id":"fbab011d-7c9c-48a9-976c-94c7014c9dc8","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:efa0aa419c9d8e3d448a3f7b7483857746fbf09b98ea3432075e0319de711801","observation_id":"23baff92-09ec-44bc-b276-cfc749cfebd6","resolution":{"observed_at":"2026-07-09T02:15:55.755812Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.03732","last_updated":"2023-11-28T03:23:20Z","snapshot_observed_at":"2026-08-08T21:34:35.024914Z","submitted_at":"2023-11-28T03:23:20Z","title":"A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA","version":1},"cited_work":{"arxiv_id":"2312.03732","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.03732","snapshot_observed_at":"2026-07-04T16:19:56.302830Z","title":"A Rank Stabilization Scaling Factor for Fine-Tuning with LoRA","venue":"cs.CL","work_id":"107c6606-e629-4ec8-b1f4-a5b9c8a5a59e","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2312.03732","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:b559a4960224744aedc9873d9c8c600c68c534b2110d1f3d0786c60aa612d6d7","observation_id":"7ff36dbe-4960-4c72-8e23-06371cd32365","resolution":{"observed_at":"2026-06-30T13:24:40.044299Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.10684","last_updated":"2022-10-26T16:14:05Z","snapshot_observed_at":"2026-08-03T02:24:22.577450Z","submitted_at":"2021-12-20T17:05:11Z","title":"Efficient Large Scale Language Modeling with Mixtures of Experts","version":2},"cited_work":{"arxiv_id":"2112.10684","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2112.10684","snapshot_observed_at":"2026-07-01T22:36:16.721505Z","title":"Artetxe et al., Efficient Large-Scale Language Modeling with Mixture of Experts","venue":null,"work_id":"711d98e0-b9e1-4350-b81d-a621de85a6bb","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2112.10684","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:201f883ece1804fef395e9ef5b2ddc0e8444faa73f14a03de715f7c45bf8a714","observation_id":"54776406-cfa2-4997-b3f1-36e6e72426e5","resolution":{"observed_at":"2026-06-30T13:24:40.034915Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2312.09877","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-30T13:24:40.051853Z","title":"Distributed learning of mixtures of experts,","venue":null,"work_id":"8207079b-9c9a-4b29-be4a-2c4e423867aa","year":2023},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:769638ea5a47e1bed8055d51f7fd29b91fdbbd7bbf461f00596b5599c7284273","observation_id":"b22a778a-affb-4b01-9be5-44d51091e2c0","resolution":{"observed_at":"2026-06-30T13:24:40.053339Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.742903Z","title":"Mmoe: Enhancing multimodal models with mixtures of multimodal interaction experts,","venue":null,"work_id":"65d90393-0eb8-4498-8a95-af281084febf","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:fe97862a2eb65ec277cc276b31d400eea05c2c9dd759790397572f503d6fed60","observation_id":"f7f23c40-a066-4dea-8b3e-e1434b54a81c","resolution":{"observed_at":"2026-07-09T02:15:55.744323Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.737974Z","title":"From sparse to soft mixtures of experts,","venue":null,"work_id":"0ef75b56-072e-484f-bde1-7938f9abb85a","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:81eed76a2540786f4985fa50d8617e8423d9044500cf0ad9a5209e5ecfe2b9bc","observation_id":"cc0a9091-386b-456b-97bd-f15c69fd2c6b","resolution":{"observed_at":"2026-07-09T02:15:55.739996Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.740897Z","title":"Efficient large scale language modeling with mixtures of experts,","venue":null,"work_id":"5c2ab534-28d0-48d7-9ecc-e1cda555d263","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:bb105e1675e1a73afdfaf64f9f9b2d3468eac3e2e1862ad363c171e6c638f67d","observation_id":"ebce3a09-c70a-49f7-b0dc-49d7aae20417","resolution":{"observed_at":"2026-07-09T02:15:55.742288Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.745719Z","title":"A paradigm shift in machine translation: Boosting translation performance of large language models,","venue":null,"work_id":"a7eac859-b071-48a2-a153-fff28e8df989","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:3dd7aeeef76d8f06b6e7caaad553ef93475de80c35074dfae1d9af95c3db559f","observation_id":"b6661529-bc30-4564-9395-01fa3f54c404","resolution":{"observed_at":"2026-07-09T02:15:55.747450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.734212Z","title":"X-ALMA: plug & play modules and adaptive rejection for quality translation at scale,","venue":null,"work_id":"fa276d06-40a0-46ec-a028-7ef1236b153c","year":2025},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:d79301e456fdb45c79073069f8d3ad21780a4bc6deb83d7f41144581183a5971","observation_id":"75733831-677b-4085-9f1c-567a41879d7d","resolution":{"observed_at":"2026-07-09T02:15:55.737130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.730121Z","title":"Digital signal processing: signals systems and filters,","venue":null,"work_id":"3dbbe996-8f0e-454b-9d88-168586ee706d","year":2006},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:956c5678a1429c9558390c382af87d608219d5c234a4c8fb2a1c96c64ea90508","observation_id":"bac60625-ef22-4d28-aa72-3e384348031c","resolution":{"observed_at":"2026-07-09T02:15:55.731430Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.725463Z","title":"On the relation between linguistic typology and (limitations of) multilin- gual language modeling,","venue":null,"work_id":"5cfa5b5e-631f-4f09-be27-430adab8ea59","year":2018},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:7ca7c926cb3cf2291b2ef76f8f173307ae3c71f0111ed2bdea8b2449f2aa3784","observation_id":"54fbd862-d15e-44c3-ae13-493d8aa42eff","resolution":{"observed_at":"2026-07-09T02:15:55.727347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.727957Z","title":"Frequency of basic english grammatical structures: A corpus analysis,","venue":null,"work_id":"5ab70df1-60b3-4c04-86a3-93a33c231d31","year":2007},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:f8ab04456f364a2f0aa83cab0f58f6509cbd631e6db2035838cbec4101e1be2a","observation_id":"5ed78e74-7e38-47d7-9807-ca2b36449346","resolution":{"observed_at":"2026-07-09T02:15:55.729448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.04459","last_updated":"2018-08-09T14:21:35Z","snapshot_observed_at":"2026-07-06T06:55:29.884811Z","submitted_at":"2018-08-09T14:21:35Z","title":"Deep Learning Based Natural Language Processing for End to End Speech Translation","version":1},"cited_work":{"arxiv_id":"1808.04459","doi":null,"metadata_source":"pith","pith_arxiv_id":"1808.04459","snapshot_observed_at":"2026-06-30T13:24:40.060004Z","title":"Deep Learning Based Natural Language Processing for End to End Speech Translation","venue":"cs.CL","work_id":"0f457119-8515-4727-a4c5-1f4ba50c93b2","year":2018},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/1808.04459","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:4930157392bdb3a5c8c6405ffe6adfead78682468a22f5dd6be7ce7fa11e9bef","observation_id":"93450a82-3363-4d2f-9f85-8ccb0068db68","resolution":{"observed_at":"2026-06-30T13:24:40.061527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.732043Z","title":"Dnn-based cross-lingual voice conversion using bottleneck features,","venue":null,"work_id":"98a0d1ca-6312-402d-9c57-257234d79cf5","year":2029},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:28b3ac2577a805af8789561fbb1e7ce72e14d8ef982684d18a3c214d3b2cba67","observation_id":"dd716170-496e-4968-afd0-1381307d20e6","resolution":{"observed_at":"2026-07-09T02:15:55.733641Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.748104Z","title":"Learn- ing a Fourier transform for linear relative positional encodings in transformers,","venue":null,"work_id":"c45cb660-0442-4fc4-bcdc-9faf574e628c","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:fb19792fe2b611a3267d0999355711b6325aa6c16cfc6bcb40aa565d07cc5409","observation_id":"f828a622-6b8f-4025-afb5-705a06478711","resolution":{"observed_at":"2026-07-09T02:15:55.749593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.756451Z","title":"Learnable fourier features for multi-dimensional spatial positional encoding,","venue":null,"work_id":"2ca5621a-fce5-4ea9-afa8-6ce5ae3dd90d","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:2ed3a64f763fff72f6f2284237295520e3bfe7c64aac4225fc697c06e3b4d1de","observation_id":"9990986c-9eeb-4881-85fb-e5ddc8365424","resolution":{"observed_at":"2026-07-09T02:15:55.757862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.17739","last_updated":"2025-07-14T04:23:36Z","snapshot_observed_at":"2026-08-11T05:11:42.984383Z","submitted_at":"2024-12-23T17:44:01Z","title":"Fourier Position Embedding: Enhancing Attention's Periodic Extension for Length Generalization","version":4},"cited_work":{"arxiv_id":"2412.17739","doi":"10.48550/arxiv.2412.17739","metadata_source":"arxiv_reference","pith_arxiv_id":"2412.17739","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fourier position embedding: Enhancing attention’s periodic extension for length generalization","venue":"arXiv (Cornell University)","work_id":"9793f2ed-d21a-44bf-931e-e6a815a7c54b","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2412.17739","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:bc2ff773b5cf413bb682e4ad05e1d78027c4b0839d1dc593b64122f10741162b","observation_id":"bdca59fe-1cc1-4e18-bb3f-e8a47482b1de","resolution":{"observed_at":"2026-06-30T13:24:40.046732Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.715146Z","title":"Transformer feed-forward layers are key-value memories,","venue":null,"work_id":"02a747c5-0028-49ab-b24b-2fbcabc214d1","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:b2c56c9a38e44b9111ef2bd5144873579b5801450d439356537622a4bcedb428","observation_id":"693ee2d9-dccb-4da6-b248-6149b7fb80bb","resolution":{"observed_at":"2026-07-09T02:15:55.718880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.708619Z","title":"Knowledge neurons in pretrained transformers,","venue":null,"work_id":"aa41f256-6fe1-439c-9d8c-734e6f2f3784","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:f564b61bd54133dfd2c2a0e6aed48fb89e1750d1e5d3b57ca36a1df8504f46e4","observation_id":"3e51d6fd-c253-49a3-b50b-5fa9a1d370a2","resolution":{"observed_at":"2026-07-09T02:15:55.709907Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.712680Z","title":"A mathematical framework for transformer circuits,","venue":null,"work_id":"6daf88ea-6b76-4abf-b7a2-1071d9f45b59","year":2021},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:09564c489cb6bf08dac8adae5cdac57b09a6b16bfde8e699e1f8b657a769d5b1","observation_id":"f3456fb0-e2e1-4e01-9872-e75f87871e2e","resolution":{"observed_at":"2026-07-09T02:15:55.713977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":"2401.04088","doi":"10.48550/arxiv.2401.04088","metadata_source":"pith","pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mixtral of Experts","venue":"cs.LG","work_id":"0de8c352-9daa-4e1e-8c7b-3d0dec69f369","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:1ce2a23a5ca1c35bdb2e8656d2e94e6a0fa1b5e76146d5740aa0d9b04cd5503c","observation_id":"a3c94869-ccd5-484f-8dab-7b8f4e98c635","resolution":{"observed_at":"2026-06-30T13:24:40.060223Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-08T21:08:09.485243+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.702909Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity","venue":null,"work_id":"4441acab-91f3-4612-a5fb-138d54a2ef74","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:04df9479b4bc66dd04820fa3f502de6f8d894fe879c60d141baf828cde8636b6","observation_id":"fc2fd4dc-d50b-433a-a1b7-e14bb062ee98","resolution":{"observed_at":"2026-07-09T02:15:55.704350Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.704945Z","title":"Mixtral of experts,","venue":null,"work_id":"bfcc0111-39f2-452c-8d6b-8c5a5d4b0def","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:80a13dc102e17a29f099f31985b76cb7b50140854888362f35c0f8141ba33844","observation_id":"52883347-d3c3-494e-9d62-596a83e0b925","resolution":{"observed_at":"2026-07-09T02:15:55.706080Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15708","last_updated":"2024-11-24T04:26:04Z","snapshot_observed_at":"2026-08-11T00:43:43.515954Z","submitted_at":"2024-11-24T04:26:04Z","title":"LLaMA-MoE v2: Exploring Sparsity of LLaMA from Perspective of Mixture-of-Experts with Post-Training","version":1},"cited_work":{"arxiv_id":"2411.15708","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15708","snapshot_observed_at":"2026-07-04T03:49:29.875637Z","title":"Llama-moe v2: Exploring sparsity of llama from perspective of mixture-of-experts with post-training","venue":null,"work_id":"edde3884-dd00-485b-b770-36999dfdef84","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2411.15708","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:a79ba05c3ef3c047881154f595d1e75f32cc7346f442d54f92629b77b27f9297","observation_id":"b53b3918-19bd-483b-a301-bf0f97f2f32a","resolution":{"observed_at":"2026-06-30T13:24:40.055476Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.710669Z","title":"Llama-moe: Building mixture-of-experts from llama with continual pre- training,","venue":null,"work_id":"7d0caae1-7f40-45cf-933f-0486e4383672","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:e133eb920211b624329b5f66a50346378eb4465e5f8b0487cb23ce07f7df8684","observation_id":"837416b3-be07-438f-b32a-e80c8c2bebcd","resolution":{"observed_at":"2026-07-09T02:15:55.712064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":"2409.02060","doi":"10.48550/arxiv.2409.02060","metadata_source":"pith","pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"OLMoE: Open Mixture-of-Experts Language Models","venue":"cs.CL","work_id":"91fa6600-4fda-4022-b2c7-205e8a242a49","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:faabef281838b2e0c29dcf58dfdbbe39c179c02e653be72482aa0c617fcb2ab7","observation_id":"a8115eab-883b-4773-b1a9-dd2ad2b91beb","resolution":{"observed_at":"2026-06-30T13:24:40.058817Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.750258Z","title":"A call for clarity in reporting BLEU scores,","venue":null,"work_id":"98a0c5fd-223c-478d-a90b-6b6158fe6745","year":2018},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:9e9eea13d460f6fe3793de31a45ff65e5d2c653dffb2c3370329d7ac36d811fb","observation_id":"d1d0f6f3-a27c-4917-bdff-06e6e73b8fb0","resolution":{"observed_at":"2026-07-09T02:15:55.751537Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.697413Z","title":"METEOR: an automatic metric for MT evalu- ation with improved correlation with human judgments,","venue":null,"work_id":"f2f719e5-af30-423c-9fae-0e2564088e57","year":2005},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:978d1bbd7ccda8c85f2035c3ad7fdc9c241bdffe5f3f854a64f448d82e997d7c","observation_id":"d2d00e2b-e238-4c4a-8f6a-054af2b199df","resolution":{"observed_at":"2026-07-09T02:15:55.698687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.699267Z","title":"COMET: A neural framework for MT evaluation,","venue":null,"work_id":"aa98d2fb-8904-4021-bb43-df6b9e64985b","year":2020},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:0c57229afa4afe91c074799adf0d3233fd8eb902d1ce6e2418b722aca4128cfc","observation_id":"b591dbee-3af1-4710-bffd-bf6e623fb035","resolution":{"observed_at":"2026-07-09T02:15:55.700522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.781351Z","title":"Qa-lora: Quantization-aware low-rank adaptation of large language models,","venue":null,"work_id":"e9c23185-cb77-4492-8b39-98bdac7567ba","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:676cef031a7586a8c399eec7f5ab4268f04d524f35f4fb943a73f00d965fe4b3","observation_id":"9c98f2e7-23ba-4ca5-9eff-6653dc61fb32","resolution":{"observed_at":"2026-07-09T02:15:55.782722Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.688297Z","title":"Llama pro: Progressive llama with block expansion,","venue":null,"work_id":"420d7cb5-f2e1-4c4d-b5aa-04aeb30319f1","year":2024},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:28fd7341390ab889f602cb7f705f6ea0cfde087197b465915c7577b9aeb6b027","observation_id":"de54399a-77fa-48b8-9e16-75b3a0a0cae0","resolution":{"observed_at":"2026-07-09T02:15:55.689527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T02:15:55.686403Z","title":"Flashattention: Fast and memory-efficient exact attention with io-awareness,","venue":null,"work_id":"9bd5babf-6656-4430-b5bc-046d5a27b4c6","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:dae49e3202fc6b9b6397a42bd2d1855994f296d89e427d478c03c912aee4cb28","observation_id":"6a2a1550-5278-4d9a-a1ec-b38b378cd7b4","resolution":{"observed_at":"2026-07-09T02:15:55.687728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2207.04672","last_updated":"2022-08-25T17:10:53Z","snapshot_observed_at":"2026-07-06T13:29:47.927628Z","submitted_at":"2022-07-11T07:33:36Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","version":3},"cited_work":{"arxiv_id":"2207.04672","doi":"10.18653/v1/w19-5207","metadata_source":"pith","pith_arxiv_id":"2207.04672","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"No Language Left Behind: Scaling Human-Centered Machine Translation","venue":"cs.CL","work_id":"68c8336c-d20e-40fa-ba9c-89459da6fc1a","year":2022},"citing_paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-30T13:22:40.017922Z"},"links":{"cited_paper":"/paper/2207.04672","citing_paper":"/paper/2605.24681"},"observation_digest":"sha256:810a684f7d700c5a8a7de0730812543cc48f4eba7f58dd4da4c081870ba415df","observation_id":"12e4b530-7b64-4062-8f87-51202af09a93","resolution":{"observed_at":"2026-06-30T13:24:40.056217Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2605.24681","last_updated":"2026-05-23T17:35:43Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T23:34:43.210149Z","submitted_at":"2026-05-23T17:35:43Z","title":"Mix-MoE: Improving Multilingual Machine Translation of Large Language Models through Mixed MoEs"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":0,"verified_exact":14,"verified_fuzzy":44},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2605.24681."}