{"as_of":"2026-08-21T13:14:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:231682757a14857d051a3ac9baf61aa8c0060754b592d7e235655ad76efe3af5","coverage":[{"denominator":60,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":60,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T15:04:38.340700Z","state":"measured"},{"denominator":78,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":78,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":18,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":18,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:16:19.730935Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:40:03.205634Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-11T13:17:49.944262Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.13328","last_updated":"2025-05-25T03:09:17Z","snapshot_observed_at":"2026-08-20T22:00:41.204211Z","submitted_at":"2024-12-17T20:55:42Z","title":"Expansion Span: Combining Fading Memory and Retrieval in Hybrid State Space Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T13:17:49.944262Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2412.13328"},"observation_digest":"sha256:82d162d82b12a302a739043d2c9f6800c643ddd800c0658c4f038447f9cae57a","observation_id":"dbb27202-deb7-4ee8-b609-32f7de9cb3a5","resolution":{"observed_at":"2026-08-11T13:17:49.944262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-08-13T00:23:14.495568Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:437c9bf72ad8a0e9d8bddbc8b2c9f61e6249bd6f2763da40ead7f47f31b65696","observation_id":"511592ce-da80-49e7-a645-db5cee068e8c","resolution":{"observed_at":"2026-05-23T01:05:16.204147Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-16T11:16:19.730935Z","title":"The zamba2 suite: Technical report.arXiv preprint arXiv:2411.15242, 2024a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.16053","last_updated":"2025-04-22T17:30:36Z","snapshot_observed_at":"2026-08-19T15:35:35.914332Z","submitted_at":"2025-04-22T17:30:36Z","title":"LongMamba: Enhancing Mamba's Long Context Capabilities via Training-Free Receptive Field Enlargement","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:16:19.730935Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2504.16053"},"observation_digest":"sha256:ef5f8afb8dc4e92c75e03630b7d176c0561b57629c25393318a94a7b6553ac4a","observation_id":"021c7a22-b247-4b44-84f0-21ce7882fa0b","resolution":{"observed_at":"2026-08-16T11:16:19.730935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-07T04:48:38.464248Z","title":"Glorioso, Q","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09613","last_updated":"2025-06-11T11:14:57Z","snapshot_observed_at":"2026-08-17T22:37:33.159058Z","submitted_at":"2025-06-11T11:14:57Z","title":"SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T04:48:38.464248Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2506.09613"},"observation_digest":"sha256:49211064662cb8c13985411544c214cb5ccfe07df95a9d9c571551c4398d3de8","observation_id":"c5f87c24-ede5-4183-ba96-f8f2899182f2","resolution":{"observed_at":"2026-08-07T04:48:38.464248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:321f2c5ab05175ff8d6a45af4ebca65a349853cb31080b6e455634980c288d05","observation_id":"7cedab62-7fae-4d28-bc68-0dc68f18b2a8","resolution":{"observed_at":"2026-05-18T10:21:15.138479Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2604.22050","last_updated":"2026-05-14T14:11:19Z","snapshot_observed_at":"2026-08-13T17:32:49.351103Z","submitted_at":"2026-04-23T20:12:19Z","title":"LayerBoost: Layer-Aware Attention Reduction for Efficient LLMs","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-09T22:20:14.285350Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2604.22050"},"observation_digest":"sha256:53d170662e39e008f147c18729fb4a913d82f31e2858cd131869c0965de2495c","observation_id":"19b1b630-6f19-4e84-acd8-35d21ca6d74f","resolution":{"observed_at":"2026-05-09T22:49:15.703080Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2605.05066","last_updated":"2026-08-06T14:35:06Z","snapshot_observed_at":"2026-08-17T16:25:09.243513Z","submitted_at":"2026-05-06T16:01:43Z","title":"The Impossibility Triangle of Long-Context Modeling","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T17:17:44.033300Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2605.05066"},"observation_digest":"sha256:e9cc6d42834b53453bebec7a915f86ebcdd849e8fc224eb5253e53fe27eea638","observation_id":"ce5f62a9-f21a-4102-862c-a43f2704c25a","resolution":{"observed_at":"2026-05-11T17:41:09.008678Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2605.05365","last_updated":"2026-05-06T18:44:08Z","snapshot_observed_at":"2026-08-16T18:16:47.637991Z","submitted_at":"2026-05-06T18:44:08Z","title":"ZAYA1-8B Technical Report","version":1},"reference_index":172,"source":"arxiv_source","source_observed_at":"2026-05-08T17:36:37.182196Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2605.05365"},"observation_digest":"sha256:4b098232371f79ea9d6faca01f99c01cd2f82640b233eaf40713c94d26fa4138","observation_id":"66d059d1-a877-442f-8b35-8a46beabc224","resolution":{"observed_at":"2026-05-11T17:26:05.375664Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2605.22416","last_updated":"2026-05-21T12:37:34Z","snapshot_observed_at":"2026-08-18T04:11:06.728696Z","submitted_at":"2026-05-21T12:37:34Z","title":"Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-22T07:28:35.020478Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2605.22416"},"observation_digest":"sha256:a45cb8610e2bf4fc1500767811abae3eec9d84e47a79c1d1cd4e68e82fc1460a","observation_id":"7a6cea06-f8a6-4b78-9de1-0d4e59351183","resolution":{"observed_at":"2026-05-22T07:31:14.115031Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2606.00390","last_updated":"2026-05-29T22:12:40Z","snapshot_observed_at":"2026-07-06T23:41:05.637982Z","submitted_at":"2026-05-29T22:12:40Z","title":"Zamba2-VL Technical Report","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T22:34:20.970856Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2606.00390"},"observation_digest":"sha256:683035681890e395ed8eac328b9559f9e284ba6128bd1ada19c38b193eefd1b8","observation_id":"81c6b540-72ef-486e-890c-773e05e4ca6d","resolution":{"observed_at":"2026-07-01T19:26:00.712927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2606.02332","last_updated":"2026-06-02T05:51:37Z","snapshot_observed_at":"2026-08-12T12:19:54.312161Z","submitted_at":"2026-06-01T14:42:06Z","title":"Forget Attention: Importance-Aware Attention Is All You Need","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.948032Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2606.02332"},"observation_digest":"sha256:2aee41feab9b5e37eb5e98f37b9057138a24cdd941a8fcf1361cd8916f27092f","observation_id":"ff872b85-e87c-499a-8d3a-e8c0c4f7de46","resolution":{"observed_at":"2026-07-01T23:06:21.052889Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2606.03014","last_updated":"2026-06-02T01:40:33Z","snapshot_observed_at":"2026-08-18T10:30:51.054620Z","submitted_at":"2026-06-02T01:40:33Z","title":"MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T11:34:24.019560Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2606.03014"},"observation_digest":"sha256:7e6d426f6f243e7b724153dfed9d52e149f687e13338d11edb531c6911599abe","observation_id":"b1b14f43-e1a7-4d40-9dc6-0a48381093fd","resolution":{"observed_at":"2026-07-02T01:46:26.674510Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":1},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-06-25T22:37:15.072758Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:e85137f54526271b8df2c1d685c3556a477c956cc3a215fb61018ff667204e30","observation_id":"7acb927d-71b2-43e4-aa4a-e094447a5932","resolution":{"observed_at":"2026-07-04T18:40:03.206937Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":"2411.15242","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-07-04T18:40:03.205634Z","title":"The zamba2 suite: Technical report","venue":null,"work_id":"306995de-58e3-4848-a8c6-12087f56bf36","year":2024},"citing_paper":{"arxiv_id":"2606.24320","last_updated":"2026-06-25T20:48:22Z","snapshot_observed_at":"2026-07-06T23:58:54.018557Z","submitted_at":"2026-06-23T08:57:34Z","title":"ZONOS2 Technical Report","version":2},"reference_index":213,"source":"arxiv_source","source_observed_at":"2026-06-29T02:07:31.791835Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2606.24320"},"observation_digest":"sha256:0acdea6a8684eb326c6237ebc76da9868b58b5368b1211808166dea576166c4d","observation_id":"e49a6fe6-6ad2-4298-ad91-dfbe6eccca35","resolution":{"observed_at":"2026-07-01T18:15:58.947175Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-02T06:39:21.486507Z","title":"The Zamba2 suite: Technical report.arXiv preprint arXiv:2411.15242, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-17T02:39:45.759545Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:21.486507Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:b28f105dd1c6229938fc7abc4c667a9d5e0237a9cde43a3263efd8caef6d6987","observation_id":"950f8509-5ccb-41bf-893d-bb726ed96038","resolution":{"observed_at":"2026-08-02T06:39:21.486507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-03T02:03:23.103188Z","title":"The Zamba2 suite: Technical report.arXiv preprint arXiv:2411.15242, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-17T02:39:45.759545Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:23.103188Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:d010368c230c3a161f324626b9074107bf7cf571297ebde522189e88865589cb","observation_id":"be520e97-6d05-4bcf-8e83-abd7f191bf0a","resolution":{"observed_at":"2026-08-03T02:03:23.103188Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-01T09:52:06.353911Z","title":"arXiv preprint arXiv:2411.15242 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.27308","last_updated":"2026-07-29T17:49:04Z","snapshot_observed_at":"2026-08-05T10:53:49.344314Z","submitted_at":"2026-07-29T17:49:04Z","title":"ZUNA1.1: A more flexible EEG foundation model for Denoising and Super-resolution","version":1},"reference_index":182,"source":"arxiv_source","source_observed_at":"2026-08-01T09:52:06.353911Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2607.27308"},"observation_digest":"sha256:df52a2761ac7fe21507c4d976058d56780e99a05366352d72af1e5003b0caf87","observation_id":"3ceafc7c-f9f3-47f3-ba6b-e8e2a017f950","resolution":{"observed_at":"2026-08-01T09:52:06.353911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15242","snapshot_observed_at":"2026-08-16T00:18:34.748692Z","title":"The zamba2 suite: Technical report.arXiv preprint arXiv:2411.15242,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.12149","last_updated":"2026-08-12T15:11:18Z","snapshot_observed_at":"2026-08-19T10:35:36.899787Z","submitted_at":"2026-08-12T15:11:18Z","title":"Massive Activations in Hybrid Linear Attention Large Language Models: Pre-Attention Spikes and Inter-Spike Plateaus","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T00:18:34.748692Z"},"links":{"cited_paper":"/paper/2411.15242","citing_paper":"/paper/2608.12149"},"observation_digest":"sha256:fdd77b1e0c669fda7f6b231ba5b97f2305abbcb158cbcc3d801144b21ad7d7e5","observation_id":"7d39d2e4-ab2e-4fa0-807e-4b3fc554fa30","resolution":{"observed_at":"2026-08-16T00:18:34.748692Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.15242/citation-record","integrity":"/paper/2411.15242/integrity","json":"/paper/2411.15242/citation-record.json","paper":"/paper/2411.15242"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-17T03:25:04.404839Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-12T15:04:38.061391Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.061391Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:4ade94ceed055568179a7c6f0fb9543e535d04014de36ef7ac4fc690c8e53b05","observation_id":"f00b46be-ea73-427a-a9d6-7762a9df72ad","resolution":{"observed_at":"2026-08-12T15:04:38.061391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14489","last_updated":"2024-01-30T21:26:09Z","snapshot_observed_at":"2026-08-21T09:06:11.438289Z","submitted_at":"2024-01-25T19:50:31Z","title":"The Case for Co-Designing Model Architectures with Hardware","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14489","snapshot_observed_at":"2026-08-12T15:04:38.067249Z","title":"The case for co-designing model architectures with hardware, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.067249Z"},"links":{"cited_paper":"/paper/2401.14489","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:36259b9eb1318ed37749cd292658b4c59f6a8fa070ae5f7606de211856b93fbe","observation_id":"2f55f682-927c-4488-8b49-ae682b886d55","resolution":{"observed_at":"2026-08-12T15:04:38.067249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:39.069078Z","title":"The Zyphra Cookbook","venue":null,"work_id":"b0a1d7cb-5e87-4ab5-a4bf-af4d18f30264","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.072160Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:5f0fa2b2a94a4dfec2ff4e4bc059dac23e107645432b5a59cd0e9492b2d5f68e","observation_id":"4d9f0a63-8fcc-4ed0-93a6-81facd1e6cd4","resolution":{"observed_at":"2026-08-12T15:04:39.072906Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01771","last_updated":"2024-02-01T07:15:58Z","snapshot_observed_at":"2026-08-16T14:22:36.905315Z","submitted_at":"2024-02-01T07:15:58Z","title":"BlackMamba: Mixture of Experts for State-Space Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01771","snapshot_observed_at":"2026-08-12T15:04:38.076559Z","title":"Blackmamba: Mixture of experts for state-space models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.076559Z"},"links":{"cited_paper":"/paper/2402.01771","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:a8d79b3e5c9db27b1909e8e09cbba2ca3dec2c819d12ed5a041213e1772c1c6c","observation_id":"9d7a1a0f-575b-4ede-a48c-d725ed0499a8","resolution":{"observed_at":"2026-08-12T15:04:38.076559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:39.055741Z","title":"Infinity instruct","venue":null,"work_id":"985c5eed-9472-4c1e-acbb-bc53f7dd5494","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.081147Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:8073c2927177b368a574dfba30fc5167abd7505a1d350a73f8c51ff2e78da045","observation_id":"6e16033e-57cd-4036-adc5-de9bba97386a","resolution":{"observed_at":"2026-08-12T15:04:39.059796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:39.043981Z","title":"Orca dpo pairs","venue":null,"work_id":"1a9a8191-1aed-46d1-b9ca-ad18aa709ee4","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.085466Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:278ca901de838a0ee72ec599cfecb30c6f487ace0237b38cfc5f150c640c10df","observation_id":"b7aa2cad-7a8d-42cc-b9d8-b5c28355f71d","resolution":{"observed_at":"2026-08-12T15:04:39.047938Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.03476","last_updated":"2024-06-05T17:29:15Z","snapshot_observed_at":"2026-08-19T20:50:06.838406Z","submitted_at":"2024-06-05T17:29:15Z","title":"Does your data spark joy? Performance gains from domain upsampling at the end of training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.03476","snapshot_observed_at":"2026-08-12T15:04:38.090863Z","title":"Does your data spark joy? performance gains from domain upsampling at the end of training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.090863Z"},"links":{"cited_paper":"/paper/2406.03476","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:895bba74958984dd4554088659dc846fda6c1c3486bbf96899dd052d0ede1d65","observation_id":"659a3b3d-41c5-458b-888d-a765d68b6739","resolution":{"observed_at":"2026-08-12T15:04:38.090863Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.095727Z","title":"NTK-Aware Scaled RoPE allows LLaMA models to have extended (8k+) context size without any fine-tuning and minimal perplexity degradation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.095727Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:63988faaa05e8d9fa8a3b96f52fb0d4e83e6c34401bfa7e07207101f05854dbc","observation_id":"0700ba3e-c107-4830-a417-a584e7d217bf","resolution":{"observed_at":"2026-08-12T15:04:38.095727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.3555","last_updated":"2014-12-11T06:46:53Z","snapshot_observed_at":"2026-08-20T00:41:09.240026Z","submitted_at":"2014-12-11T06:46:53Z","title":"Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.3555","snapshot_observed_at":"2026-08-12T15:04:38.100356Z","title":"Empirical evaluation of gated recurrent neural networks on sequence modeling, 2014","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.100356Z"},"links":{"cited_paper":"/paper/1412.3555","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:7c9ce0b78e8967954c8c3a66273175810dbba4e0d93297287c611ac4997064d7","observation_id":"3d138598-0cf9-40e2-bfda-0cd2d6ea809e","resolution":{"observed_at":"2026-08-12T15:04:38.100356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01377","last_updated":"2024-07-16T03:24:39Z","snapshot_observed_at":"2026-08-14T00:28:11.851309Z","submitted_at":"2023-10-02T17:40:01Z","title":"UltraFeedback: Boosting Language Models with Scaled AI Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01377","snapshot_observed_at":"2026-08-12T15:04:38.106540Z","title":"Ultrafeedback: Boosting language models with scaled ai feedback, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.106540Z"},"links":{"cited_paper":"/paper/2310.01377","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:6771f433959efaee3c244ddccd8ca0b70209c5ebd3cca699d8a74ae3d1a2879b","observation_id":"3ca05d15-4022-4934-9873-d2f98fecd010","resolution":{"observed_at":"2026-08-12T15:04:38.106540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-12T15:04:38.111469Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.111469Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:885bd234f5cf2c55ef522ef8dbf2319a5eb2463531c66052b3a7d192802efb3e","observation_id":"b0543c93-2e3d-4e0f-9989-b4712460724d","resolution":{"observed_at":"2026-08-12T15:04:38.111469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2208.07339","snapshot_observed_at":"2026-08-12T15:04:38.117430Z","title":"Llm.int8(): 8-bit matrix multiplication for transformers at scale, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.117430Z"},"links":{"cited_paper":"/paper/2208.07339","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:6431095a45900d212b7a2f51045f1d4c5ce8991aa36a2dc0f1c38c930f49e645","observation_id":"10470e39-fe44-44f0-8881-33d378f8c3af","resolution":{"observed_at":"2026-08-12T15:04:38.117430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-08-20T16:10:20.713555Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14314","snapshot_observed_at":"2026-08-12T15:04:38.123088Z","title":"Qlora: Efficient finetuning of quantized llms, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.123088Z"},"links":{"cited_paper":"/paper/2305.14314","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:a51c50c5b05718acf7cb9b0b2574e689a009445ec4cb00f3b9b48213a345715f","observation_id":"087a5292-9bcf-4f89-90e7-ebd0a0727092","resolution":{"observed_at":"2026-08-12T15:04:38.123088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14233","last_updated":"2023-05-23T16:49:14Z","snapshot_observed_at":"2026-08-18T05:06:04.678949Z","submitted_at":"2023-05-23T16:49:14Z","title":"Enhancing Chat Language Models by Scaling High-quality Instructional Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14233","snapshot_observed_at":"2026-08-12T15:04:38.128772Z","title":"Enhancing chat language models by scaling high-quality instructional conversations, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.128772Z"},"links":{"cited_paper":"/paper/2305.14233","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:c411bab191acb5b5c25750fd22a05c3f92b5bf92216fa4ccffff9f1d71c2ed2d","observation_id":"eb8ddb45-74cc-4920-b303-3442d236b5a6","resolution":{"observed_at":"2026-08-12T15:04:38.128772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-21T05:15:28.840279Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-12T15:04:38.136654Z","title":"Gemma 2: Improving open language models at a practical size, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.136654Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:5a74f0f2eee55d152b85940e8d681a39160edff85f05f08b88e1dbc6efc9c439","observation_id":"f9183024-6e2a-4b74-9157-a597f796fad4","resolution":{"observed_at":"2026-08-12T15:04:38.136654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-12T15:04:38.141255Z","title":"Gemma: Open models based on gemini research and technology","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.141255Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:de8bc0ba46b2f17bee58803d081181203c43445ea3217c94c5aa7b2083024c0e","observation_id":"795ceaf5-aca0-4c27-91d3-469bc7ec9eae","resolution":{"observed_at":"2026-08-12T15:04:38.141255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-12T15:04:38.145841Z","title":"Zamba: A Compact 7B SSM Hybrid Model , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.145841Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:e955c5dec13446f15ec3df826a935cf208523a07ebe04b5ae143ce3699e46bea","observation_id":"19166029-e271-4142-a9e1-1b814ee8c439","resolution":{"observed_at":"2026-08-12T15:04:38.145841Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:39.024630Z","title":"Is mamba capable of in-context learning?, 2024","venue":null,"work_id":"9a85ed8e-1a2d-47ea-b227-cf39c0aef8fd","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.151720Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:e5716f14a4ed20bf296ac3c0038f26f119782abea2af70abba57207f9316e204","observation_id":"e8e56229-3e78-4b5f-94db-5c6c6dd112ab","resolution":{"observed_at":"2026-08-12T15:04:39.028684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T15:04:38.155927Z","title":"Mamba: Linear-time sequence modeling with selective state spaces","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.155927Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:f16ac4da73967cc501ec38a340479b73b17f1df6323f7ad3bb00cc41806e9ced","observation_id":"eaca669c-6221-467a-92d1-4f97bab80ebc","resolution":{"observed_at":"2026-08-12T15:04:38.155927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1712.00409","last_updated":"2017-12-01T17:13:14Z","snapshot_observed_at":"2026-08-14T02:46:56.838057Z","submitted_at":"2017-12-01T17:13:14Z","title":"Deep Learning Scaling is Predictable, Empirically","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1712.00409","snapshot_observed_at":"2026-08-12T15:04:38.162171Z","title":"Deep learning scaling is predictable, empirically","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.162171Z"},"links":{"cited_paper":"/paper/1712.00409","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:443844c217ca1de404ba0327966db5daf3e1bcea91d0fcebdf82ff6410fdbd3b","observation_id":"420d9e9f-d01b-4d47-b59e-955e53bf6671","resolution":{"observed_at":"2026-08-12T15:04:38.162171Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.167743Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.167743Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:64e0cf2dcdf5ec48565295e825410c53c760de9922dce8dcb0fe938caa4c6fb9","observation_id":"3fb1c95e-dfbf-49c9-bb8f-1403ac446aa6","resolution":{"observed_at":"2026-08-12T15:04:38.167743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.171891Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.171891Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:5a77fc196eb10bfb397033a7fbc8f19bd36f6574690e717e2c09343e1d3dda57","observation_id":"c1e1a6d3-6ff1-4d60-897a-64651ed071e0","resolution":{"observed_at":"2026-08-12T15:04:38.171891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.09685","last_updated":"2021-10-16T18:40:34Z","snapshot_observed_at":"2026-08-20T11:47:17.477107Z","submitted_at":"2021-06-17T17:37:18Z","title":"LoRA: Low-Rank Adaptation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.09685","snapshot_observed_at":"2026-08-12T15:04:38.175619Z","title":"Lora: Low-rank adaptation of large language models","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.175619Z"},"links":{"cited_paper":"/paper/2106.09685","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:abae4983c4980db24af24dc507ac7a7275382a044bf39d45a08a345eea9ae472","observation_id":"9572ef53-6785-4704-853a-1ea751f0f3c6","resolution":{"observed_at":"2026-08-12T15:04:38.175619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-12T15:04:38.179971Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.179971Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:0f2402555c4b794573850867b0acf28095696070135d7009bd10c8208e6c4ca3","observation_id":"9e85111f-2d89-4e33-ab98-78db6aad6200","resolution":{"observed_at":"2026-08-12T15:04:38.179971Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.996995Z","title":"Open Hermes Preferences","venue":null,"work_id":"e24a4205-58ec-40da-8f50-d1f405b38902","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.184019Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:f78cb2815e50e53d8cb6c253a2d4448a683de149002aab1772cb3a48604d6a24","observation_id":"eab5d780-c318-4b77-af36-a9c77c807496","resolution":{"observed_at":"2026-08-12T15:04:39.001125Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08763","last_updated":"2024-09-04T16:13:18Z","snapshot_observed_at":"2026-08-16T14:10:04.613423Z","submitted_at":"2024-03-13T17:58:57Z","title":"Simple and Scalable Strategies to Continually Pre-train Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08763","snapshot_observed_at":"2026-08-12T15:04:38.188161Z","title":"Simple and scalable strategies to continually pre-train large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.188161Z"},"links":{"cited_paper":"/paper/2403.08763","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:2a005dbc84a48066dbea54972383d4f30f5c04013199f4c68d2b4c0411d97ed1","observation_id":"f013f16e-9803-4efe-9f5e-55e1b6ac7ed8","resolution":{"observed_at":"2026-08-12T15:04:38.188161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12570","last_updated":"2024-08-22T17:38:59Z","snapshot_observed_at":"2026-08-19T18:56:26.707023Z","submitted_at":"2024-08-22T17:38:59Z","title":"Jamba-1.5: Hybrid Transformer-Mamba Models at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12570","snapshot_observed_at":"2026-08-12T15:04:38.192137Z","title":"Jamba-1.5: Hybrid transformer-mamba models at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.192137Z"},"links":{"cited_paper":"/paper/2408.12570","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:cdedec3882890b5c97c2ae7a483e89355d55a63acb64a88286172459d4348a54","observation_id":"80869967-a21b-43ce-a84b-a79f289dd0ed","resolution":{"observed_at":"2026-08-12T15:04:38.192137Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T15:04:38.196420Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.196420Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:7db715ecf77ee7fddf4be1803d977cf001282bff16a3933ca02106b3c86c526f","observation_id":"79019d00-09d1-40fe-9bff-9e3b13b27ba1","resolution":{"observed_at":"2026-08-12T15:04:38.196420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T15:04:38.201749Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.201749Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:87f569d1214b745c741fa8ad3f90c86064bdd135db945335917f8d5c8fc1c1eb","observation_id":"cd60478a-b3a3-43af-ad06-835acc4ff766","resolution":{"observed_at":"2026-08-12T15:04:38.201749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.206228Z","title":"Transformers are rnns: Fast autoregressive transformers with linear attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.206228Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:7e5be457323754fdb884ffa4fbc9296bdb1c56863fa2984d74c6b67692e031b9","observation_id":"387a1834-3768-40d8-a72c-6c083bd5895f","resolution":{"observed_at":"2026-08-12T15:04:38.206228Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-08-17T19:26:44.032537Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-12T15:04:38.210067Z","title":"Adam: A method for stochastic optimization","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.210067Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:d1c38ee9c44f1c47b1deb93b4f921705ad0f910d00df9251f50b99daf4b43916","observation_id":"1786eae4-4b92-454b-8120-0a7f5ea9a661","resolution":{"observed_at":"2026-08-12T15:04:38.210067Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11794","last_updated":"2025-04-21T17:48:15Z","snapshot_observed_at":"2026-08-19T17:37:52.818614Z","submitted_at":"2024-06-17T17:42:57Z","title":"DataComp-LM: In search of the next generation of training sets for language models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11794","snapshot_observed_at":"2026-08-12T15:04:38.213896Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.213896Z"},"links":{"cited_paper":"/paper/2406.11794","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:cea9ef95599ee7496c2cb60bb023d6ae3b6f665d584de0b7bf54a8b23c7b4cb0","observation_id":"c58b1e88-0104-48f8-b17c-3c40b654cebe","resolution":{"observed_at":"2026-08-12T15:04:38.213896Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-12T15:04:38.217913Z","title":"Starcoder: may the source be with you!, 2023 a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.217913Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:7b3255cf5efdfcf38bf0342af60235666326a9a722abdfbd1c6fd952e3891dd4","observation_id":"26e3c0a4-a387-4e69-8ba9-d53eddb36ec7","resolution":{"observed_at":"2026-08-12T15:04:38.217913Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-12T15:04:38.222534Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.222534Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:28fd1e5afaee04504a4a8a0d685e4ba9a7436ab201328fc2521e8b1b0dc13ddd","observation_id":"dfc7f9a2-0172-417a-bc77-5e4cea1a7031","resolution":{"observed_at":"2026-08-12T15:04:38.222534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.970084Z","title":"Openorca: An open dataset of gpt augmented flan reasoning traces","venue":null,"work_id":"0768370c-573e-46db-9aad-0669a0cfceb4","year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.226829Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:0b66ad4cc0b70e1a8ebbe4cac594a84024052a36f3af61059f7c9d05e7993f87","observation_id":"a19dbd74-0413-4c82-9c39-c812d4e8979b","resolution":{"observed_at":"2026-08-12T15:04:38.975199Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.231014Z","title":"Jamba: A hybrid transformer-mamba language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.231014Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:672bc5f762bc1294926c8ef21e044f73ea8ead0f690a6ad9d96a51c3a3157740","observation_id":"40576ec4-3af7-4ae4-9c0c-ca084231e763","resolution":{"observed_at":"2026-08-12T15:04:38.231014Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T15:04:38.235078Z","title":"The llama 3 herd of models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.235078Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:e9dee356b9cfe50d11a79ae1d285582e04faca66f91f213a604e1d1866b2b6bd","observation_id":"3c5ff820-a1c6-40c3-ae10-71223d84c5b8","resolution":{"observed_at":"2026-08-12T15:04:38.235078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.239240Z","title":"Peft: State-of-the-art parameter-efficient fine-tuning methods","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.239240Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:f7abce87e3f765da18031bcc61b0af6cf8ba2fd8d7903e8532d9c38f5c8ee54a","observation_id":"a634bdbb-fba2-4b7b-8ae7-8a98f9c71b33","resolution":{"observed_at":"2026-08-12T15:04:38.239240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.942934Z","title":"Introducing Meta Llama 3: The most capable openly available LLM to date","venue":null,"work_id":"00c45294-15ff-4e76-8263-5390cb9985be","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.242875Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:1bc2811a2da9e2d774ed777307bc309cd34e0d01c20def2058ed16e8bd6628da","observation_id":"3d2f3346-8296-49f4-ae55-f544fd357abf","resolution":{"observed_at":"2026-08-12T15:04:38.946926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04248","last_updated":"2024-04-25T17:01:52Z","snapshot_observed_at":"2026-08-16T14:20:53.387690Z","submitted_at":"2024-02-06T18:56:35Z","title":"Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04248","snapshot_observed_at":"2026-08-12T15:04:38.246881Z","title":"Can mamba learn how to learn? a comparative study on in-context learning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.246881Z"},"links":{"cited_paper":"/paper/2402.04248","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:651ba449472fe6222923f4a2bd8f839f749db952fbacfc05144ec228b2e2b90b","observation_id":"32070188-a430-4769-9409-2071a6e87337","resolution":{"observed_at":"2026-08-12T15:04:38.246881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.930544Z","title":"Can mamba learn how to learn? a comparative study on in-context learning tasks, 2024 b","venue":null,"work_id":"2462b198-17ce-4422-8895-b59209afc112","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.251636Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:3792910ed23d8b253f995ae8ab7aa13d86dd44e59131c82a0ed3cb61de63c86a","observation_id":"d0408dc6-642d-40db-9ef2-e6a98c897e16","resolution":{"observed_at":"2026-08-12T15:04:38.934886Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17557","last_updated":"2024-10-31T11:37:49Z","snapshot_observed_at":"2026-08-20T16:41:47.138179Z","submitted_at":"2024-06-25T13:50:56Z","title":"The FineWeb Datasets: Decanting the Web for the Finest Text Data at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17557","snapshot_observed_at":"2026-08-12T15:04:38.255873Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.255873Z"},"links":{"cited_paper":"/paper/2406.17557","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:d51be99d83ed41bca9911e4b672b1e4096820cb627738de575cd9716e5b227f9","observation_id":"92106d9b-2470-4af2-b038-857279f9f6bb","resolution":{"observed_at":"2026-08-12T15:04:38.255873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.260182Z","title":"Wind, Stanislaw Wozniak, Ruichong Zhang, Zhenyuan Zhang, Qihang Zhao, Peng Zhou, Qinghua Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.260182Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:5d6ac32c456dd31df5589107a96e95721eaffb76463795435854abcb30f96677","observation_id":"11de0fe9-08bb-4dc2-a96a-f5d5b232ca49","resolution":{"observed_at":"2026-08-12T15:04:38.260182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.909923Z","title":"au2, Niklas Muennighoff, Fares Obeid, Atsushi Saito, Guangyu Song, Haoqin Tu, Stanisław Woźniak, Ruichong Zhang, Bingchen Zhao, Qihang Zhao, Peng Zhou, Jian Zhu, and Rui-Jie Zhu","venue":null,"work_id":"b5aa083c-5f74-443b-89c0-96fa40a077ff","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.263997Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:9647ce225bedbad1913237d5db73bf0552df8a445deb3c49ca328406acfc5d30","observation_id":"54ab5171-0d1e-4d80-8266-b32390e83005","resolution":{"observed_at":"2026-08-12T15:04:38.915042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-12T15:04:38.268007Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.268007Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:e551b86906e99dc6c1a47445678bca8b9aee2b001b41b744d9f285fa415fe27c","observation_id":"57658cef-db31-4c95-9644-2c1e69cb1453","resolution":{"observed_at":"2026-08-12T15:04:38.268007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.18290","last_updated":"2024-07-29T22:26:36Z","snapshot_observed_at":"2026-08-01T16:34:38.795326Z","submitted_at":"2023-05-29T17:57:46Z","title":"Direct Preference Optimization: Your Language Model is Secretly a Reward Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.18290","snapshot_observed_at":"2026-08-12T15:04:38.274101Z","title":"Manning, and Chelsea Finn","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.274101Z"},"links":{"cited_paper":"/paper/2305.18290","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:31c3749151baf3120b667753293ac6af5b545eadd0d4c549ae7cb03f0024e3e8","observation_id":"bbd089d6-6866-459c-9c17-557a35839e6c","resolution":{"observed_at":"2026-08-12T15:04:38.274101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-12T15:04:38.278698Z","title":"Zero: Memory optimizations toward training trillion parameter models, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.278698Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:e3f04ceed8c594673ca7167652ca3de3cad54a8962cb6b47735dd87d1f4ffa7d","observation_id":"473a0a33-7ea0-4a85-b225-779c160121f1","resolution":{"observed_at":"2026-08-12T15:04:38.278698Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00159","last_updated":"2024-06-06T18:46:40Z","snapshot_observed_at":"2026-08-18T13:13:10.222946Z","submitted_at":"2024-01-31T20:29:50Z","title":"Dolma: an Open Corpus of Three Trillion Tokens for Language Model Pretraining Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00159","snapshot_observed_at":"2026-08-12T15:04:38.283890Z","title":"Peters, Abhilasha Ravichander, Kyle Richardson, Zejiang Shen, Emma Strubell, Nishant Subramani, Oyvind Tafjord, Pete Walsh, Luke Zettlemoyer, Noah A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.283890Z"},"links":{"cited_paper":"/paper/2402.00159","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:778b9b15065e9352ab80480674ed352b1d341ddeaea8e7c9dcbaed69bd718738","observation_id":"86c51a05-9d95-4d12-ab0c-416cce76fa8c","resolution":{"observed_at":"2026-08-12T15:04:38.283890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-17T06:56:20.644738Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-12T15:04:38.289440Z","title":"Roformer: Enhanced transformer with rotary position embedding, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.289440Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:7202a6ca9d103aff4a8d91c3e1c0411b508eabcb8eef7d25b76e4b65263f6a91","observation_id":"a702250e-e175-40c1-af86-c7411d5b6104","resolution":{"observed_at":"2026-08-12T15:04:38.289440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.294666Z","title":"Openhermes 2.5: An open dataset of synthetic data for generalist llm assistants, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.294666Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:a01f21b716c49c7016d4eb15c4b7f898fe951cdc48894abf6b453349d7eb7030","observation_id":"15db5fdd-dd72-44c1-8253-6926d967313a","resolution":{"observed_at":"2026-08-12T15:04:38.294666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.889937Z","title":"Zyda: A 1.3T Dataset for Open Language Modeling , 2024","venue":null,"work_id":"97ec6a7b-b048-4392-8fbe-11bc775c2ce1","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.298935Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:61ceb973d35b5e2cbf6b9ebc2da5af2d5b8de012e2da8aa1d8cb40e51d679f91","observation_id":"69283ad4-0843-4ec2-b69e-af5ebb2bf969","resolution":{"observed_at":"2026-08-12T15:04:38.893941Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.302967Z","title":"Attention is all you need","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.302967Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:be516f48e84131ae1ede4f2131d2a6167f7bde9a8701f2ea9c9a4389c678d3db","observation_id":"24f7be8b-d558-4807-83a9-0f11fc1767a3","resolution":{"observed_at":"2026-08-12T15:04:38.302967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-12T15:04:38.307370Z","title":"An empirical study of mamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.307370Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:31c413f4b39903704c5b28cd4a2334084cc5285ef8dfab6b27160dce5538c1fc","observation_id":"9b421110-4569-411a-86fe-9986bb04e2ef","resolution":{"observed_at":"2026-08-12T15:04:38.307370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-08-20T09:53:02.008012Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-12T15:04:38.312548Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.312548Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:5b0967db834f4b2f18e1002f31a28fe3f74c751c1c01f42ed5beb26acf1a94e6","observation_id":"4036c3eb-13e1-4c04-a5bf-b953a00fce25","resolution":{"observed_at":"2026-08-12T15:04:38.312548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-21T01:26:32.098232Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-12T15:04:38.316694Z","title":"Gated linear attention transformers with hardware-efficient training, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.316694Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:6c52b88bd1c07a2c92523a119d34aad414e0bc827c85f1d023a385a14ff835dd","observation_id":"d0d95405-1021-47d1-85e4-6cab2bbc636b","resolution":{"observed_at":"2026-08-12T15:04:38.316694Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.866077Z","title":"Building Zyda-2 , a 5 Trillion Token High-Quality Dataset , with NVIDIA NeMo Curator , October 2024","venue":null,"work_id":"a010a48e-f472-4218-bdfc-4453d5eeb115","year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.321245Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:6ccd87e7db0cd2d1d80a6c358e74fd1a0c204e3e42367e47d268b2a7fd13f819","observation_id":"bcf3292a-07f8-4663-9f2f-da5521cf16dc","resolution":{"observed_at":"2026-08-12T15:04:38.872806Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-12T15:04:38.325059Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.325059Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:816b7202e98a03aa96dd6ef0a9050a4215ddf0639375b6e3d64ab09a5502d3ce","observation_id":"ad4ff2c6-ddda-4dae-8203-2f42410eafbb","resolution":{"observed_at":"2026-08-12T15:04:38.325059Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-12T15:04:38.329873Z","title":"Instruction-following evaluation for large language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.329873Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:96a76664c2ecdc9cbe5be649477a2f520265c619650f87be67d67d788191374a","observation_id":"9a729c77-40d6-4664-9247-ae94f622aba1","resolution":{"observed_at":"2026-08-12T15:04:38.329873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05355","last_updated":"2024-10-07T15:40:45Z","snapshot_observed_at":"2026-08-20T14:51:10.875950Z","submitted_at":"2024-10-07T15:40:45Z","title":"Falcon Mamba: The First Competitive Attention-free 7B Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05355","snapshot_observed_at":"2026-08-12T15:04:38.336043Z","title":"Falcon mamba: The first competitive attention-free 7b language model, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.336043Z"},"links":{"cited_paper":"/paper/2410.05355","citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:21013df15b5c7ff6a34c705e85aabf9f85b6b91bbe09d4738ce651cb81cfc27e","observation_id":"c4b94a19-6078-430f-95a9-2ad9eea0be12","resolution":{"observed_at":"2026-08-12T15:04:38.336043Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T15:04:38.340700Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-12T15:04:38.340700Z"},"links":{"citing_paper":"/paper/2411.15242"},"observation_digest":"sha256:ca26bd232e01de1a815a46df9f8379bde6563cf81e79b9f83765b5a113e8483f","observation_id":"35ba5c94-b359-46b7-b05c-dfcdccfb544a","resolution":{"observed_at":"2026-08-12T15:04:38.340700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2411.15242","last_updated":"2024-11-22T02:55:20Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T05:08:15.609977Z","submitted_at":"2024-11-22T02:55:20Z","title":"The Zamba2 Suite: Technical Report"},"reference_resolution":{"displayed":60,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":49,"verified_exact":0,"verified_fuzzy":11},"total_outbound_references":60},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 21 August 2026, this Paper Citation Record lists 60 of 60 outbound references and 18 inbound Pith citation observations for arXiv:2411.15242."}