{"as_of":"2026-08-06T03:01:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:4b15beb7879a50b64a7a5dce5484bb0c128869d49fc15d3c17ec32fe4032560c","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:17:42.154186Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T07:13:54.031036Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T07:06:43.816739Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"cited_work":{"arxiv_id":"2508.18756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18756","snapshot_observed_at":"2026-07-02T07:06:43.816739Z","title":"Ultramemv2: Memory networks scaling to 120b parameters with superior long-context learning.arXiv preprint arXiv:2508.18756","venue":null,"work_id":"afa03ee2-92d3-4db6-849a-f79a88ccd8f9","year":2025},"citing_paper":{"arxiv_id":"2512.13751","last_updated":"2026-05-09T08:34:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-12-15T05:50:45Z","title":"MIDUS: Memory-Infused Depth Up-Scaling","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-16T22:02:42.297041Z"},"links":{"cited_paper":"/paper/2508.18756","citing_paper":"/paper/2512.13751"},"observation_digest":"sha256:fdbb056071b6e8606fcd064cdbcf6b65a1b8896eddcf00246694857ef6fa4e1e","observation_id":"9c5b9c36-33bd-4b84-8514-b1935b865e6d","resolution":{"observed_at":"2026-05-16T22:03:36.159265Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"cited_work":{"arxiv_id":"2508.18756","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2508.18756","snapshot_observed_at":"2026-07-02T07:06:43.816739Z","title":"Ultramemv2: Memory networks scaling to 120b parameters with superior long-context learning.arXiv preprint arXiv:2508.18756","venue":null,"work_id":"afa03ee2-92d3-4db6-849a-f79a88ccd8f9","year":2025},"citing_paper":{"arxiv_id":"2606.09888","last_updated":"2026-06-03T09:10:06Z","snapshot_observed_at":"2026-08-02T01:54:56.458376Z","submitted_at":"2026-06-03T09:10:06Z","title":"SinkRec: Mitigating Semantic State Sink in Long Sequence Recommendation with Memory-Conditioned Gated Delta Networks","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T07:13:54.031036Z"},"links":{"cited_paper":"/paper/2508.18756","citing_paper":"/paper/2606.09888"},"observation_digest":"sha256:4a3deafcaed916cf8d7a27d1dcb5f6fdf85cb10504413c94af27b58bd78c1479","observation_id":"18678fdf-ed1f-4050-b3ff-cb9b215df4f0","resolution":{"observed_at":"2026-07-02T07:06:43.818439Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.18756/citation-record","integrity":"/paper/2508.18756/integrity","json":"/paper/2508.18756/citation-record.json","paper":"/paper/2508.18756"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-05T16:17:41.862060Z","title":"Program synthesis with large language models.arXiv preprint arXiv:2108.07732, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.862060Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:77d7b370bd852075509b5eb4d82e99aaca08aee3944f22bfd325d7c05bde26fb","observation_id":"06d29732-220e-4398-b214-e33e734496f2","resolution":{"observed_at":"2026-08-05T16:17:41.862060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.09764","last_updated":"2024-12-20T17:36:52Z","snapshot_observed_at":"2026-08-06T02:00:43.818545Z","submitted_at":"2024-12-12T23:56:57Z","title":"Memory Layers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.09764","snapshot_observed_at":"2026-08-05T16:17:41.871650Z","title":"Memory layers at scale.arXiv preprint arXiv:2412.09764, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.871650Z"},"links":{"cited_paper":"/paper/2412.09764","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:ddc7c0d7b5510b4cb8b4bc657794e35b34fbd41746c6b4357c66affbbd9a4597","observation_id":"bf4eed67-8daf-4c43-8846-cac6c833c7be","resolution":{"observed_at":"2026-08-05T16:17:41.871650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:43.089194Z","title":"Piqa: Reasoning about physical commonsense in natural language","venue":null,"work_id":"0dd37e7f-7679-4942-be80-9bf9fc344a10","year":2020},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.882241Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:74a7666c005eea3c11bfd468723e9989f690901c2829e40c68ec2b947143cda2","observation_id":"8ec2a355-90da-4f99-b3b6-d2b9780417c3","resolution":{"observed_at":"2026-08-05T16:17:43.095234Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:41.891161Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.891161Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:0bb2d170b9d2136f8425cba43849e1cdddd3be16f08b09ee9f93261295b3bb7a","observation_id":"7176ecf7-38b0-4c4f-8966-32b3acc9f0f5","resolution":{"observed_at":"2026-08-05T16:17:41.891161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-05T16:17:41.898090Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv:1803.05457v1, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.898090Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:096aa4623e374a01ffaf943e7ce495a7df221394ef27cd0b1be56fd8384788e2","observation_id":"4ec88c91-b50e-4e60-9e65-e55879060f8b","resolution":{"observed_at":"2026-08-05T16:17:41.898090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-04T15:46:25.710484Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T16:17:41.903827Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.903827Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:1eb9f3320f4e8d25258e431cdb53b565dd2dca4ce3cf34164284da64334ff005","observation_id":"6e86179a-0fa9-41f1-8fdf-703e4db0a865","resolution":{"observed_at":"2026-08-05T16:17:41.903827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.10837","last_updated":"2023-11-21T13:58:00Z","snapshot_observed_at":"2026-07-06T16:34:11.453458Z","submitted_at":"2023-10-16T21:23:16Z","title":"Approximating Two-Layer Feedforward Networks for Efficient Transformers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.10837","snapshot_observed_at":"2026-08-05T16:17:41.909750Z","title":"Approximating two-layer feedforward networks for efficient transformers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.909750Z"},"links":{"cited_paper":"/paper/2310.10837","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:af147f389a1ec37bae9e93ce822dff8709949cf0b7341655065ce8d78b4a7cfb","observation_id":"f1c6fb34-e731-41cc-aa3f-ff880a8298ca","resolution":{"observed_at":"2026-08-05T16:17:41.909750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06066","last_updated":"2024-01-11T17:31:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-11T17:31:42Z","title":"DeepSeekMoE: Towards Ultimate Expert Specialization in Mixture-of-Experts Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06066","snapshot_observed_at":"2026-08-05T16:17:41.916736Z","title":"Deepseekmoe: Towards ultimate expert specialization in mixture-of-experts language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.916736Z"},"links":{"cited_paper":"/paper/2401.06066","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:b4fa2ae91eeeeeae78af5532a8529a88aeaad8b119144af8bf452963d390b4a5","observation_id":"bd542213-d772-41c0-9435-d9a454db8c4f","resolution":{"observed_at":"2026-08-05T16:17:41.916736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:43.050187Z","title":"DROP: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":"a1d38254-30c2-4bd0-b567-6f3163c764fd","year":2019},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.924101Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:c4a8cf917ac48a9f559117469c2532f652863d2940db85788590fbd0807d3dd2","observation_id":"21d0a2ff-763f-45c3-83b6-db892710129a","resolution":{"observed_at":"2026-08-05T16:17:43.057371Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:41.932009Z","title":"Switch transformers: Scaling to trillion parameter models with simple and efficient sparsity.Journal of Machine Learning Research, 23(120):1–39, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.932009Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:054dc1361637f620d6e9bf2c37fcffe66a788ddfdf5f02e3ac6c705c912c3183","observation_id":"b28f6439-323b-4962-b986-44410a875be0","resolution":{"observed_at":"2026-08-05T16:17:41.932009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.13262","last_updated":"2021-03-24T15:27:15Z","snapshot_observed_at":"2026-08-05T06:16:26.422684Z","submitted_at":"2021-03-24T15:27:15Z","title":"FastMoE: A Fast Mixture-of-Expert Training System","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.13262","snapshot_observed_at":"2026-08-05T16:17:41.941220Z","title":"Fastmoe: A fast mixture-of-expert training system","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.941220Z"},"links":{"cited_paper":"/paper/2103.13262","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:cf2a0f1f74659e260862e8aec27040ee232567c093c3dfa3184dae0d1cba8093","observation_id":"90764af7-1ac7-4b06-8082-f40da840398e","resolution":{"observed_at":"2026-08-05T16:17:41.941220Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04153","last_updated":"2024-07-04T20:59:20Z","snapshot_observed_at":"2026-07-06T18:41:44.784690Z","submitted_at":"2024-07-04T20:59:20Z","title":"Mixture of A Million Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04153","snapshot_observed_at":"2026-08-05T16:17:41.950238Z","title":"Mixture of a million experts.arXiv preprint arXiv:2407.04153, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.950238Z"},"links":{"cited_paper":"/paper/2407.04153","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:c6eebd3718e3c104f1dc3ff6b69f891a86a545517212aef96389d43137338e8a","observation_id":"7b5d0f0f-6f70-4f1f-9b93-74b345fadb35","resolution":{"observed_at":"2026-08-05T16:17:41.950238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:41.956630Z","title":"Aligning ai with shared human values.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.956630Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:a258a81c0076cd1c41c8a31ed3684d39c5f756a16a0a42242d71458fe5b9f17f","observation_id":"e8412630-7a60-4108-8d70-e5f05c4506fb","resolution":{"observed_at":"2026-08-05T16:17:41.956630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:41.963854Z","title":"Measuring massive multitask language understanding.Proceedings of the International Conference on Learning Representations (ICLR), 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.963854Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:49237cf883708b08cf53f50e43a9b1b690d15f484bb4a26a07c8da65e46ccce4","observation_id":"74431a28-f424-4255-9527-53e7dcb99fd1","resolution":{"observed_at":"2026-08-05T16:17:41.963854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:41.973737Z","title":"Measuring mathematical problem solving with the math dataset.NeurIPS, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.973737Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:2b4a83320fc38544d600216f27f48505f4254d8d8cd3f014e2166ebd5a115071","observation_id":"552c83df-6bf9-4d15-91a2-b1eebbd700d8","resolution":{"observed_at":"2026-08-05T16:17:41.973737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.16975","last_updated":"2025-05-23T08:32:07Z","snapshot_observed_at":"2026-08-03T06:20:50.307224Z","submitted_at":"2025-01-28T14:15:42Z","title":"Over-Tokenized Transformer: Vocabulary is Generally Worth Scaling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.16975","snapshot_observed_at":"2026-08-05T16:17:41.981651Z","title":"Over-tokenized transformer: Vocabulary is generally worth scaling.arXiv preprint arXiv:2501.16975, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.981651Z"},"links":{"cited_paper":"/paper/2501.16975","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:3de54f8d448fff765d3ea25bd51385ed155c7c9898d0a2967e965c6c387de2ec","observation_id":"2dd5a2a9-6fac-496a-b3a1-432231d05997","resolution":{"observed_at":"2026-08-05T16:17:41.981651Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.957538Z","title":"C-eval: A multi-level multi-discipline chinese evaluation suite for foundation models","venue":null,"work_id":"e495be9e-4e0f-4230-859b-bb995f4d8926","year":2023},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.989216Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:68f03718ae9296d56f9495d7c67f8bfa9aac8f8af965649e688d31dfe008f732","observation_id":"d9fc7fbc-9f52-419b-9d0c-6cbae2d58457","resolution":{"observed_at":"2026-08-05T16:17:42.964852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.12364","last_updated":"2025-02-06T09:36:58Z","snapshot_observed_at":"2026-08-04T06:56:33.572912Z","submitted_at":"2024-11-19T09:24:34Z","title":"Ultra-Sparse Memory Network","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.12364","snapshot_observed_at":"2026-08-05T16:17:41.998354Z","title":"Ultra-sparse memory network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:41.998354Z"},"links":{"cited_paper":"/paper/2411.12364","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:7f48c2ef51b6cf853923cc3bedf511f51239f08b2061e192a96714fd652e1e22","observation_id":"e8ecbb92-aa3c-432f-9a7c-a9f8c04ef171","resolution":{"observed_at":"2026-08-05T16:17:41.998354Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.05767","last_updated":"2025-06-06T05:51:29Z","snapshot_observed_at":"2026-08-04T03:08:06.815620Z","submitted_at":"2025-06-06T05:51:29Z","title":"dots.llm1 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.05767","snapshot_observed_at":"2026-08-05T16:17:42.004470Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.004470Z"},"links":{"cited_paper":"/paper/2506.05767","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:a415c45ce6404511779a297c4ac9f868ab6ba616342c735a40347c5ceb0134ef","observation_id":"f339dd7c-1b5f-4c73-b747-c9875d60c6f5","resolution":{"observed_at":"2026-08-05T16:17:42.004470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.010279Z","title":"Product quantization for nearest neighbor search.IEEE transactions on pattern analysis and machine intelligence, 33(1):117–128, 2010","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.010279Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:1383d21e380c5fef42ea2be9b8c34e619662460516e5c1cf34dd34c7a4a64334","observation_id":"aa57d30e-03f4-47d6-8ff9-e67b51d831d7","resolution":{"observed_at":"2026-08-05T16:17:42.010279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-05T16:17:42.015268Z","title":"Mixtral of experts.arXiv preprint arXiv:2401.04088, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.015268Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:4d0193c8664cd1d24ce0b82e1605df00906d024af5cd40228eec2062f30ceef5","observation_id":"ac4e10c0-960f-4123-be6b-4c0c545c5a69","resolution":{"observed_at":"2026-08-05T16:17:42.015268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.020585Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.020585Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:f6b54663e95f54bd2a78d05af6355b24a5e13c1f58edccfcde92e35e03694167","observation_id":"5448c1fb-c3ec-4903-9c3c-64346f545032","resolution":{"observed_at":"2026-08-05T16:17:42.020585Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-05T16:17:42.025904Z","title":"triviaqa: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension.arXiv e-prints, art","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.025904Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:823f4397416d37c781eabf044ed4d260bdbda32d61bb0a2bccc7da1e89952b4f","observation_id":"c4b2915f-07ec-48e6-9918-706388389735","resolution":{"observed_at":"2026-08-05T16:17:42.025904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.03881","last_updated":"2020-10-08T10:19:50Z","snapshot_observed_at":"2026-07-06T10:02:35.988410Z","submitted_at":"2020-10-08T10:19:50Z","title":"Large Product Key Memory for Pretrained Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.03881","snapshot_observed_at":"2026-08-05T16:17:42.032313Z","title":"Large product key memory for pretrained language models.arXiv preprint arXiv:2010.03881, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.032313Z"},"links":{"cited_paper":"/paper/2010.03881","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:a6202bafe4c1dc812fd781e5ea7d4aab17b2817bbff710a25a38fca5191713fd","observation_id":"e005e7a5-2a00-4426-85f7-543c19ac5dec","resolution":{"observed_at":"2026-08-05T16:17:42.032313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07871","last_updated":"2024-02-12T18:33:47Z","snapshot_observed_at":"2026-08-01T16:05:25.800937Z","submitted_at":"2024-02-12T18:33:47Z","title":"Scaling Laws for Fine-Grained Mixture of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07871","snapshot_observed_at":"2026-08-05T16:17:42.037489Z","title":"Scaling laws for fine-grained mixture of experts","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.037489Z"},"links":{"cited_paper":"/paper/2402.07871","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:728879e66b466262104d3e2b04b07b8346ae7e7081be40abb3914c77d14f65ef","observation_id":"e766e8a8-41d6-4b09-a7bd-4f0b18b05e96","resolution":{"observed_at":"2026-08-05T16:17:42.037489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.911659Z","title":"Large memory layers with product keys.Advances in Neural Information Processing Systems, 32, 2019","venue":null,"work_id":"d44460ab-7306-4887-9320-01bf98406135","year":2019},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.043484Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:d5e881fff5ec31a557fcd6f3f8c103a50b51954b75f6c7de4185bab493e3e521","observation_id":"33ab54b5-1975-4c31-8a67-f73c40d16c14","resolution":{"observed_at":"2026-08-05T16:17:42.918347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-05T16:17:42.050746Z","title":"Deepseek-v3 technical report.arXiv preprint arXiv:2412.19437, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.050746Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:b2209a6141e9537edbd67e5ffedb53f54ebd8611ea75a198755fdc954ca4b91d","observation_id":"f8dc512d-f6d8-4d4e-8e75-efa4d47529ac","resolution":{"observed_at":"2026-08-05T16:17:42.050746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.058600Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.058600Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:ba99b655e2802f112acf4e70c19771421b3fe2e9fd292b4bba259702ce886fa7","observation_id":"21d9ec13-c829-41cc-9880-81543435c15d","resolution":{"observed_at":"2026-08-05T16:17:42.058600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02060","last_updated":"2025-03-03T01:25:46Z","snapshot_observed_at":"2026-07-29T16:11:06.082798Z","submitted_at":"2024-09-03T17:08:20Z","title":"OLMoE: Open Mixture-of-Experts Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02060","snapshot_observed_at":"2026-08-05T16:17:42.066072Z","title":"Olmoe: Open mixture-of-experts language models.arXiv preprint arXiv:2409.02060, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.066072Z"},"links":{"cited_paper":"/paper/2409.02060","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:fcad46027658c51d29ed8ef2fb0b833d63a3b3b34b94204e354be93b158cf220","observation_id":"d9140e8c-5cb1-454c-9934-2386a73cfa2f","resolution":{"observed_at":"2026-08-05T16:17:42.066072Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.05895","last_updated":"2019-12-30T03:53:04Z","snapshot_observed_at":"2026-07-06T08:29:10.516150Z","submitted_at":"2019-10-14T02:23:43Z","title":"Transformers without Tears: Improving the Normalization of Self-Attention","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.05895","snapshot_observed_at":"2026-08-05T16:17:42.074129Z","title":"Transformers without tears: Improving the normalization of self-attention","venue":null,"work_id":null,"year":1910},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.074129Z"},"links":{"cited_paper":"/paper/1910.05895","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:5e2b4238a7c5278bd89e3c20418525756d835511a58cf15419e466973a8173a1","observation_id":"0b698c83-5376-4f15-832e-f29ac974cc19","resolution":{"observed_at":"2026-08-05T16:17:42.074129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.081799Z","title":"Deepspeed-moe: Advancing mixture-of-experts inference and training to power next-generation ai scale","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.081799Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:0bf36d771597a95ae4fc9b2bacb145353d83914283e92092320c5d4a0e3df464","observation_id":"673c66de-f8de-4e25-af8b-aa7ff99e8d7e","resolution":{"observed_at":"2026-08-05T16:17:42.081799Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.10641","last_updated":"2019-11-21T19:01:32Z","snapshot_observed_at":"2026-07-06T08:09:59.842324Z","submitted_at":"2019-07-24T18:11:59Z","title":"WinoGrande: An Adversarial Winograd Schema Challenge at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.10641","snapshot_observed_at":"2026-08-05T16:17:42.088345Z","title":"Winogrande: An adversarial winograd schema challenge at scale.arXiv preprint arXiv:1907.10641, 2019","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.088345Z"},"links":{"cited_paper":"/paper/1907.10641","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:da8b564c85ad52b6795dd4c049efce9a7fd3e444a9aa8c8127b4898c40e1b51f","observation_id":"7e3617df-af46-4e77-bc6f-63f84a873655","resolution":{"observed_at":"2026-08-05T16:17:42.088345Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-05T16:17:42.097567Z","title":"Glu variants improve transformer.arXiv preprint arXiv:2002.05202, 2020","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.097567Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:e949f47c5be25249e14f097dbed2ba742b645f5db1dd23d079ddb18745e556af","observation_id":"04d84cf5-9f83-46ab-8cbd-00cb00d46f2f","resolution":{"observed_at":"2026-08-05T16:17:42.097567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-05T16:17:42.104052Z","title":"Outrageously large neural networks: The sparsely-gated mixture-of-experts layer.arXiv preprintarXiv:1701.06538, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.104052Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:4c2be0eebb6827f5fb34d905a9002ab7aedafc0a7b833ec4a6c42a2d7f1e099f","observation_id":"d62372b7-4833-4869-904d-1f40b18da95c","resolution":{"observed_at":"2026-08-05T16:17:42.104052Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-05T16:17:42.109834Z","title":"Challenging big-bench tasks and whether chain-of-thought can solve them.arXiv preprint arXiv:2210.09261, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.109834Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:6d493ebffa6be6c9092425f1082f563c53764f0765b955678b274f46a8c0b918","observation_id":"ce438d7d-5e54-4a3c-b4a0-78845ca3dc63","resolution":{"observed_at":"2026-08-05T16:17:42.109834Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.115682Z","title":"CommonsenseQA: A question answering challenge targeting commonsense knowledge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.115682Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:8bb4b2d51c6c7c12ef313cff39a48ba0e5aa3e9dd7eb3ef35d202a7e743da358","observation_id":"e9893b79-0301-4daa-88ca-f6b7c2aa2e11","resolution":{"observed_at":"2026-08-05T16:17:42.115682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.851162Z","title":"Attention is all you need.Advances in neural information processing systems, 30, 2017","venue":null,"work_id":"4f35bea7-7ec9-4938-8c9c-57876553bf1b","year":2017},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.120614Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:bed608c8818a996b3c0299dd927e84b803761bd02e65af631b09868cb577ced1","observation_id":"7a0b0e3b-efbc-4799-98ed-7533ba8244f1","resolution":{"observed_at":"2026-08-05T16:17:42.858993Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.823304Z","title":"Moec: Mixture of expert clusters","venue":null,"work_id":"1df91d95-f0e8-43a9-b39e-0a1b8d4c09f5","year":2023},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.125390Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:3722f4970501cde4ea08aab4476581060cdcb443a1fd683dd17cab128f3b4c67","observation_id":"55063835-0b19-4ea0-8d12-83f01057f58c","resolution":{"observed_at":"2026-08-05T16:17:42.834215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-05T16:17:42.130675Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.130675Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:55ee765cd9899e06c9da1c9c76fe01ca08dcab0a6c8e1b16aecb3b5882bce8f8","observation_id":"5dcddd93-72b7-4b4a-bf0d-487940f0af07","resolution":{"observed_at":"2026-08-05T16:17:42.130675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.16057","last_updated":"2025-06-12T07:41:53Z","snapshot_observed_at":"2026-07-06T20:56:00.594770Z","submitted_at":"2025-03-20T11:45:08Z","title":"Expert Race: A Flexible Routing Strategy for Scaling Diffusion Transformer with Mixture of Experts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.16057","snapshot_observed_at":"2026-08-05T16:17:42.136085Z","title":"Expert race: A flexible routing strategy for scaling diffusion transformer with mixture of experts.arXiv preprint arXiv:2503.16057, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.136085Z"},"links":{"cited_paper":"/paper/2503.16057","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:161bca0bdc42c338961640171b001655fca6ca39802a5c63fe7a0988432ae4dc","observation_id":"277491ed-0343-46cb-b108-e7c227a182f7","resolution":{"observed_at":"2026-08-05T16:17:42.136085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.142224Z","title":"Hellaswag: Can a machine really finish your sentence? In Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.142224Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:36dac35dbc5a0366b1e4e823de83673be3e2e3b77167345be01ffabb580b8f20","observation_id":"0fd5e50b-593b-4303-934a-0ef98b620337","resolution":{"observed_at":"2026-08-05T16:17:42.142224Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.11506","last_updated":"2020-10-09T01:36:35Z","snapshot_observed_at":"2026-07-06T09:58:22.699198Z","submitted_at":"2020-09-24T06:17:10Z","title":"Ape210K: A Large-Scale and Template-Rich Dataset of Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.11506","snapshot_observed_at":"2026-08-05T16:17:42.148465Z","title":"Ape210k: A large-scale and template-rich dataset of math word problems.arXiv preprint arXiv:2009.11506, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.148465Z"},"links":{"cited_paper":"/paper/2009.11506","citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:5c0489caa0ece824aeddc294c2518f143e4ba308b6143442ea92109fe82cf1cf","observation_id":"f386348f-bd3d-400b-8408-925a8d03cd26","resolution":{"observed_at":"2026-08-05T16:17:42.148465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:17:42.779054Z","title":"Pre-values","venue":null,"work_id":"fbb37eed-7303-4893-94b9-26d0426d7b60","year":2023},"citing_paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-05T16:17:42.154186Z"},"links":{"citing_paper":"/paper/2508.18756"},"observation_digest":"sha256:f5c837d30e955e588b9877ec21869fec5ab1960edcb0e8c656d748f44b6be788","observation_id":"d97cc08f-2759-43f4-9634-36c8a1599b67","resolution":{"observed_at":"2026-08-05T16:17:42.787037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.18756","last_updated":"2025-08-26T07:33:11Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T02:00:57.442142Z","submitted_at":"2025-08-26T07:33:11Z","title":"UltraMemV2: Memory Networks Scaling to 120B Parameters with Superior Long-Context Learning"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":36,"verified_exact":0,"verified_fuzzy":7},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 6 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 2 inbound Pith citation observations for arXiv:2508.18756."}