{"as_of":"2026-08-19T11:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:668175f208439f680166e95aad9a8d493f4ee925b69dfdfb34eb6d98792f048f","coverage":[{"denominator":103,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:20:32.846517Z","state":"measured"},{"denominator":143,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":143,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":43,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T06:04:17.554378Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":2,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2501.00663","last_updated":"2024-12-31T22:32:03Z","snapshot_observed_at":"2026-08-16T10:45:05.594811Z","submitted_at":"2024-12-31T22:32:03Z","title":"Titans: Learning to Memorize at Test Time","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-14T22:08:14.982302Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2501.00663"},"observation_digest":"sha256:4524d3196c9c8994bfc1dfef11195204918ed25f0aee2ccf462c6d9132367957","observation_id":"e8dd4dfb-103d-4fdd-ba9e-d44c2d708ff1","resolution":{"observed_at":"2026-05-14T22:08:15.324590Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-10T14:12:09.285754Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.15570","last_updated":"2025-01-26T15:56:56Z","snapshot_observed_at":"2026-08-18T15:06:07.119058Z","submitted_at":"2025-01-26T15:56:56Z","title":"ARWKV: Pretrain is not what we need, an RNN-Attention-Based Language Model Born from Transformer","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T14:12:09.285754Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2501.15570"},"observation_digest":"sha256:27cc5cf3dba988691aedf404c2b20d49ebe176156366feb99927cca50623e78b","observation_id":"3cf72c39-56e3-4580-92ce-4b5fb40f27dd","resolution":{"observed_at":"2026-08-10T14:12:09.285754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2503.08223","last_updated":"2026-04-09T15:28:27Z","snapshot_observed_at":"2026-08-13T00:23:14.495568Z","submitted_at":"2025-03-11T09:41:29Z","title":"Will LLMs Scaling Hit the Wall? Breaking Barriers via Distributed Resources on Massive Edge Devices","version":3},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-05-23T01:03:26.037233Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2503.08223"},"observation_digest":"sha256:ea592906fafa13cfdeaffd97b91edc335ddb0502a6b13975331883f80a466f98","observation_id":"fea57a3b-6a94-4969-a6af-02e7ca4a10e0","resolution":{"observed_at":"2026-05-23T01:05:16.456536Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2504.17333","last_updated":"2025-04-24T07:52:02Z","snapshot_observed_at":"2026-07-06T21:14:04.815568Z","submitted_at":"2025-04-24T07:52:02Z","title":"Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-22T19:11:08.841835Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2504.17333"},"observation_digest":"sha256:bd5fa3da643c3d609437e8697c631252f879a68a55036afdff7f145c89d9d84c","observation_id":"f1b3ad46-c1d1-457c-8807-7c1adc1348d9","resolution":{"observed_at":"2026-05-22T19:11:57.910134Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-16T06:04:17.554378Z","title":"Hymba: A hybrid-head architecture for small language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.19191","last_updated":"2025-04-27T10:48:56Z","snapshot_observed_at":"2026-08-18T23:51:01.162841Z","submitted_at":"2025-04-27T10:48:56Z","title":"WuNeng: Hybrid State with Attention","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T06:04:17.554378Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2504.19191"},"observation_digest":"sha256:8f57d3e311f6ceec17dff540ce6a6def594a93b7224055b7174ac183f5d6f331","observation_id":"fe8bfa86-92cd-4487-8296-e4d8b474fb52","resolution":{"observed_at":"2026-08-16T06:04:17.554378Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-15T23:56:22.035105Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.03320","last_updated":"2025-06-03T06:56:44Z","snapshot_observed_at":"2026-08-18T10:46:29.690533Z","submitted_at":"2025-05-06T08:47:58Z","title":"Recall with Reasoning: Chain-of-Thought Distillation for Mamba's Long-Context Memory and Extrapolation","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-15T23:56:22.035105Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2505.03320"},"observation_digest":"sha256:2070bcd3fd60e5b5765217052b63ad924530968a1917234af885342b7b9df54d","observation_id":"baeac036-1bd8-40a0-aafe-0c79739615b3","resolution":{"observed_at":"2026-08-15T23:56:22.035105Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-15T22:12:58.603905Z","title":"Hymba: A hybrid-head architecture for small language models, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07793","last_updated":"2025-09-08T20:57:22Z","snapshot_observed_at":"2026-08-18T02:49:39.030741Z","submitted_at":"2025-05-12T17:45:05Z","title":"Overflow Prevention Enhances Long-Context Recurrent LLMs","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-15T22:12:58.603905Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2505.07793"},"observation_digest":"sha256:7793dd1a3fb3e3db98c2a7790bfdecf1fba159f273ceb39dbb2b08805d3af514","observation_id":"6e606860-5a8e-47d4-8058-ddd8ec7e988d","resolution":{"observed_at":"2026-08-15T22:12:58.603905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T14:17:23.650165Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.19472","last_updated":"2025-05-28T11:06:17Z","snapshot_observed_at":"2026-08-18T01:17:55.679973Z","submitted_at":"2025-05-26T03:52:22Z","title":"Balancing Computation Load and Representation Expressivity in Parallel Hybrid Neural Networks","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T14:17:23.650165Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2505.19472"},"observation_digest":"sha256:42e2c4897ee9746b18249b768f3d418037894ccb8429a27ac11df4b162b5ca17","observation_id":"82ae23a5-1ebd-4d31-bb29-1c836f3c8e44","resolution":{"observed_at":"2026-08-07T14:17:23.650165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2506.02153","last_updated":"2025-09-15T22:15:00Z","snapshot_observed_at":"2026-08-12T13:48:47.535846Z","submitted_at":"2025-06-02T18:35:16Z","title":"Small Language Models are the Future of Agentic AI","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-16T11:55:50.897500Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.02153"},"observation_digest":"sha256:4a538c7a9ef003bfda083af095b89025d85251acd01693c5747d8d8f03a7405e","observation_id":"d21d9efc-827a-407c-8150-307bcf69d8c2","resolution":{"observed_at":"2026-05-16T11:55:51.030625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:56:56.896718Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.06579","last_updated":"2025-06-06T23:13:08Z","snapshot_observed_at":"2026-08-13T00:55:48.528355Z","submitted_at":"2025-06-06T23:13:08Z","title":"Towards Efficient Multi-LLM Inference: Characterization and Analysis of LLM Routing and Hierarchical Techniques","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:56:56.896718Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.06579"},"observation_digest":"sha256:5b988bdcd80036ab713dd95cf5b629bca2151d036f1c4ef0584d8ce126918a13","observation_id":"3b22685c-af14-40c0-8907-133b90e7a683","resolution":{"observed_at":"2026-08-07T05:56:56.896718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T05:06:32.591124Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08889","last_updated":"2025-06-10T15:17:26Z","snapshot_observed_at":"2026-08-18T03:43:14.193832Z","submitted_at":"2025-06-10T15:17:26Z","title":"SeerAttention-R: Sparse Attention Adaptation for Long Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:06:32.591124Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.08889"},"observation_digest":"sha256:f85795a7210ccc340d3dad0790e8649d59d2270c858a99e2f6c91b28369fcd72","observation_id":"5d536d28-56ee-48fd-98f7-a858af3525ea","resolution":{"observed_at":"2026-08-07T05:06:32.591124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-07T04:48:38.651983Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.09613","last_updated":"2025-06-11T11:14:57Z","snapshot_observed_at":"2026-08-17T22:37:33.159058Z","submitted_at":"2025-06-11T11:14:57Z","title":"SparseSSM: Efficient Selective Structured State Space Models Can Be Pruned in One-Shot","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T04:48:38.651983Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.09613"},"observation_digest":"sha256:b71f65193fec6036fe127c4920fd26eb092bb63d913dde56bdbfc7657676d07f","observation_id":"25719a15-1504-4c2e-84f1-b2e79e8d364b","resolution":{"observed_at":"2026-08-07T04:48:38.651983Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-06T23:28:44.573565Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.18145","last_updated":"2025-06-22T19:26:55Z","snapshot_observed_at":"2026-08-09T03:15:44.813103Z","submitted_at":"2025-06-22T19:26:55Z","title":"Routing Mamba: Scaling State Space Models with Mixture-of-Experts Projection","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T23:28:44.573565Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2506.18145"},"observation_digest":"sha256:260a5ea52b9133416022495a9a933816b32fc3eb72a63b75725fdd58ffdec384","observation_id":"b8137f2f-5bd4-4a54-b85c-6ec7b1077466","resolution":{"observed_at":"2026-08-06T23:28:44.573565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-06T20:36:00.876438Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02456","last_updated":"2025-07-03T09:13:31Z","snapshot_observed_at":"2026-08-14T20:27:28.906237Z","submitted_at":"2025-07-03T09:13:31Z","title":"System-performance and cost modeling of Large Language Model training and inference","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-06T20:36:00.876438Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2507.02456"},"observation_digest":"sha256:396d2bd4dbbce80a2f063de5f83caf8f995c8212f24d0d08f3996597765c571f","observation_id":"0d34d1ff-41e9-479a-94c8-75fe139c49a6","resolution":{"observed_at":"2026-08-06T20:36:00.876438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-06T11:44:04.935445Z","title":"Hymba: A hybrid-head architecture for small language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-16T19:03:00.202162Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.935445Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:559ecc7242e2c3c67d99a282be77d88002bdc2f253959c62ad72d4035a0e26f8","observation_id":"4e4c4713-4027-417f-aa9d-b53bbadf77ac","resolution":{"observed_at":"2026-08-06T11:44:04.935445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2509.05276","last_updated":"2026-05-08T09:41:26Z","snapshot_observed_at":"2026-08-11T05:30:18.498214Z","submitted_at":"2025-09-05T17:34:00Z","title":"SpikingBrain: Spiking Brain-inspired Large Models","version":4},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-18T18:51:06.243305Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2509.05276"},"observation_digest":"sha256:5217fc6582fb56b840ab9f14ecb9b72d438bc495261ada0e21d2681d3c278d77","observation_id":"11be0f2c-da88-4262-8e93-b57e802bb9f9","resolution":{"observed_at":"2026-05-18T18:51:45.749016Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2509.24552","last_updated":"2026-05-04T14:21:45Z","snapshot_observed_at":"2026-08-19T07:30:20.382646Z","submitted_at":"2025-09-29T10:04:12Z","title":"Short window attention enables long-term memorization","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-18T12:10:42.646127Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2509.24552"},"observation_digest":"sha256:e38556937a5c924a1e53e369b9b305da63a372a7674d2ecf5133694fd365a25d","observation_id":"5a8b7ae4-45b6-48a6-93be-61fa93b10ba5","resolution":{"observed_at":"2026-05-18T12:11:21.791249Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2510.04800","last_updated":"2026-04-21T13:16:20Z","snapshot_observed_at":"2026-08-12T17:48:16.385812Z","submitted_at":"2025-10-06T13:30:07Z","title":"Hybrid Architectures for Language Models: Systematic Analysis and Design Insights","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-18T10:18:04.431436Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2510.04800"},"observation_digest":"sha256:4f781d1e2f494e25acacea990772b622553e401e515c9b9d1b198cdc397d3df3","observation_id":"272efa11-27ed-4cf9-b197-38d0d2d85232","resolution":{"observed_at":"2026-05-18T10:21:15.114330Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2510.26692","last_updated":"2025-11-01T12:05:18Z","snapshot_observed_at":"2026-08-07T19:30:34.681869Z","submitted_at":"2025-10-30T16:59:43Z","title":"Kimi Linear: An Expressive, Efficient Attention Architecture","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T23:49:10.555255Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2510.26692"},"observation_digest":"sha256:5d5be8d8f0e2ae57295cb9d996897927521db0af408c997bbc16ce39b501498a","observation_id":"2877e21b-05ea-4b5d-99a9-8fb659bc4e14","resolution":{"observed_at":"2026-05-13T23:49:11.040289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2511.21016","last_updated":"2026-05-17T20:43:54Z","snapshot_observed_at":"2026-08-19T05:50:40.772489Z","submitted_at":"2025-11-26T03:26:37Z","title":"Gated KalmaNet: A Fading Memory Layer Through Test-Time Ridge Regression","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-21T17:59:23.826110Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2511.21016"},"observation_digest":"sha256:d5d9d4c34647195ce213095a0d25ace9964c0c24ad80349fc7c9a5f56aded007","observation_id":"50527f6e-efcb-4e44-ac2f-79c9f4ddbb18","resolution":{"observed_at":"2026-05-21T18:00:27.018953Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2601.01972","last_updated":"2026-03-20T17:28:41Z","snapshot_observed_at":"2026-08-19T06:28:23.658257Z","submitted_at":"2026-01-05T10:27:19Z","title":"Hidden State Poisoning Attacks against Mamba-based Language Models","version":4},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-16T18:15:05.108462Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2601.01972"},"observation_digest":"sha256:50a60a9862b47ad8c69662c9ac8584710a83b1c63f7594c1e037d945e0411a68","observation_id":"72f4a784-24bb-4a8d-aaa1-e1595598e1d5","resolution":{"observed_at":"2026-05-16T18:18:14.502702Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-03T04:55:41.380193Z","title":"Du, J., Sun, W., Lan, D., Hu, J., and Cheng, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.03681","last_updated":"2026-06-02T17:25:15Z","snapshot_observed_at":"2026-08-11T02:19:25.991798Z","submitted_at":"2026-02-03T16:02:50Z","title":"Neural Attention Search Linear: Towards Adaptive Token-Level Hybrid Attention Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T04:55:41.380193Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2602.03681"},"observation_digest":"sha256:4a8c1dab136141633deb57e147eb93822d0ee23d5c3983f84e7d867bcf8671ad","observation_id":"6be18e09-4e1c-4982-a403-69dfe3ce19d0","resolution":{"observed_at":"2026-08-03T04:55:41.380193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2602.13215","last_updated":"2026-05-13T00:21:04Z","snapshot_observed_at":"2026-08-16T11:25:01.080136Z","submitted_at":"2026-01-22T17:19:58Z","title":"When to Think Fast and Slow? AMOR: Adaptive Entropy Gate for Hybrid Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-16T11:48:50.587732Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2602.13215"},"observation_digest":"sha256:8e64c31354d9158b0df27f16ff5715751d3abe19fbd6dc28caace22808a87dcf","observation_id":"a624811f-df97-43d8-a275-32d8201fa572","resolution":{"observed_at":"2026-05-16T11:50:52.833832Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-07-15T12:09:16.468055Z","title":"S., Liu, S.-Y., Van Keirsbilck, M., Chen, M.-H., Suhara, Y., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2603.09221","last_updated":"2026-05-29T05:28:18Z","snapshot_observed_at":"2026-08-17T17:42:16.302165Z","submitted_at":"2026-03-10T05:42:13Z","title":"Beyond Test-Time Memory: State-Space Optimal Control for LLM Reasoning","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-15T12:09:16.468055Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2603.09221"},"observation_digest":"sha256:e337238d04a8f6a155842b71f61f8c6113d50de96984ec12e9ad3de5dcd32bbc","observation_id":"00fb7d85-b6dd-487d-9948-49c2878c645e","resolution":{"observed_at":"2026-07-15T12:09:16.468055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2604.03263","last_updated":"2026-03-12T21:21:51Z","snapshot_observed_at":"2026-08-14T20:05:21.610854Z","submitted_at":"2026-03-12T21:21:51Z","title":"LPC-SM: Local Predictive Coding and Sparse Memory for Long-Context Language Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T11:22:08.937342Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2604.03263"},"observation_digest":"sha256:cca3b8d13df206b19d643427bd29fb15ce8568ad41bbbfedda262d13f52b51b5","observation_id":"15f60ccd-f6c6-456f-89e0-71df9f3af120","resolution":{"observed_at":"2026-05-15T11:25:31.076370Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2604.07935","last_updated":"2026-07-08T13:12:46Z","snapshot_observed_at":"2026-08-14T11:06:38.521340Z","submitted_at":"2026-04-09T07:55:03Z","title":"The Hyperscale Lottery: How State-Space Models Have Sacrificed Edge Efficiency","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T17:46:11.859634Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2604.07935"},"observation_digest":"sha256:24b42549e659ac3f7973a96614a2d80ef3981e7157601518b16834a487fd9d94","observation_id":"46ca10e9-ace1-44fb-b446-132a4ae48b7f","resolution":{"observed_at":"2026-05-11T06:11:00.959927Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2604.13440","last_updated":"2026-04-15T03:40:30Z","snapshot_observed_at":"2026-08-19T07:25:58.298518Z","submitted_at":"2026-04-15T03:40:30Z","title":"A KL Lens on Quantization: Fast, Forward-Only Sensitivity for Mixed-Precision SSM-Transformer Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-10T14:24:53.745784Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2604.13440"},"observation_digest":"sha256:2d84ac283102d15b1c7b0e7c35e33eab18417482da30edcbb31e20814cb7b769","observation_id":"8bfaa0de-f961-4411-9688-08702050cf8b","resolution":{"observed_at":"2026-05-10T14:25:29.249694Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2604.22575","last_updated":"2026-04-24T14:07:54Z","snapshot_observed_at":"2026-08-19T08:51:03.597867Z","submitted_at":"2026-04-24T14:07:54Z","title":"SpikingBrain2.0: Brain-Inspired Foundation Models for Efficient Long-Context and Cross-Platform Inference","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-08T12:18:23.898779Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2604.22575"},"observation_digest":"sha256:41d76cf45efebab72ad040b0af529ae45dfdbf0e80295d9791b786321273b4c1","observation_id":"c966df19-ca58-42f5-a39a-dbba1d7478aa","resolution":{"observed_at":"2026-05-11T19:21:06.799830Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2605.06997","last_updated":"2026-05-07T22:26:27Z","snapshot_observed_at":"2026-08-16T18:35:47.399534Z","submitted_at":"2026-05-07T22:26:27Z","title":"Echo: KV-Cache-Free Associative Recall with Spectral Koopman Operators","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-11T01:26:48.026538Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2605.06997"},"observation_digest":"sha256:e121ea786113d41c1e273a15c6cac3a65a2f8706942e6ee78533038d8a8baa62","observation_id":"4b7653f2-4ada-4594-ba78-d7232a61fe89","resolution":{"observed_at":"2026-05-11T04:25:56.106800Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2605.10643","last_updated":"2026-05-11T14:31:24Z","snapshot_observed_at":"2026-08-19T05:50:43.007190Z","submitted_at":"2026-05-11T14:31:24Z","title":"A Single-Layer Model Can Do Language Modeling","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-12T04:40:12.906234Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2605.10643"},"observation_digest":"sha256:c8492b28bf19e0492bb7db5ce3c45722a7d988a20d9eac2c1bb2ad80fa2fc6b9","observation_id":"f0f0f8a2-f532-4519-9664-242e3c1996ef","resolution":{"observed_at":"2026-05-12T06:01:25.421310Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2605.22416","last_updated":"2026-05-21T12:37:34Z","snapshot_observed_at":"2026-08-18T04:11:06.728696Z","submitted_at":"2026-05-21T12:37:34Z","title":"Asymmetric Virtual Memory Paging for Hybrid Mamba-Transformer Inference","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-22T07:28:35.020478Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2605.22416"},"observation_digest":"sha256:48177f818475d8095e27e87b277d51bb3bf415ef74605e0787bf796a75f3ceae","observation_id":"33411379-0fd7-478e-9fe3-057c3e355ed0","resolution":{"observed_at":"2026-05-22T07:31:14.110433Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2605.26099","last_updated":"2026-06-05T05:36:49Z","snapshot_observed_at":"2026-07-06T23:36:01.564747Z","submitted_at":"2026-05-25T17:55:39Z","title":"Do Language Models Need Sleep? Offline Recurrence for Improved Online Inference","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-29T21:37:51.638904Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2605.26099"},"observation_digest":"sha256:0dedbcd5aa87172c6206d98ede0f884196c78126bcec9618844a87fda46c23cc","observation_id":"cdca6b76-ee6b-47b0-a7b0-a94465b616f3","resolution":{"observed_at":"2026-06-29T21:43:59.519478Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2606.02332","last_updated":"2026-06-02T05:51:37Z","snapshot_observed_at":"2026-08-12T12:19:54.312161Z","submitted_at":"2026-06-01T14:42:06Z","title":"Forget Attention: Importance-Aware Attention Is All You Need","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T14:38:40.948032Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2606.02332"},"observation_digest":"sha256:0097c53e7be24bc0b4aebdbee402dea3f7822434932bf0e45fb77aeb626c8e66","observation_id":"3e582e7f-61ba-4159-8a71-56245017eaf3","resolution":{"observed_at":"2026-07-01T23:06:21.037769Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2606.03014","last_updated":"2026-06-02T01:40:33Z","snapshot_observed_at":"2026-08-18T10:30:51.054620Z","submitted_at":"2026-06-02T01:40:33Z","title":"MOSAIC: Efficient Mixture-of-Agent Scheduling via Adaptive Aggregation and Inference Concurrency","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-06-28T11:34:24.019560Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2606.03014"},"observation_digest":"sha256:cfc00fd0133ea3092946db44bc3c86a8004b5357bcae2544bbecccec4c9732ec","observation_id":"b3841260-6ed5-4578-b69f-1fae69a1aa46","resolution":{"observed_at":"2026-06-28T11:42:04.506675Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2606.05362","last_updated":"2026-06-06T05:44:46Z","snapshot_observed_at":"2026-08-06T22:00:33.534591Z","submitted_at":"2026-06-03T19:10:07Z","title":"MOSAIC: A Workload-Driven Simulation and Design-Space Exploration Framework for Heterogeneous NPUs","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T03:21:27.016397Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2606.05362"},"observation_digest":"sha256:df1b67a96728ffcd88ff93d07aa40fffb1b4869264b83da936774762f2c58bba","observation_id":"05a06ea1-e837-4055-bad9-33086f26cb31","resolution":{"observed_at":"2026-07-02T11:36:55.115884Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2606.06302","last_updated":"2026-06-04T15:41:27Z","snapshot_observed_at":"2026-08-12T15:57:41.088886Z","submitted_at":"2026-06-04T15:41:27Z","title":"Tangram: Unlocking Non-Uniform KV Cache for Efficient Multi-turn LLM Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T02:25:46.234576Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2606.06302"},"observation_digest":"sha256:fdfe307fb86d51d8107a6b63001551f66d09444daca982139ecefcd3bce979b6","observation_id":"df0f8b44-3048-4a66-82ff-512de8879512","resolution":{"observed_at":"2026-07-02T12:06:56.124721Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2606.07604","last_updated":"2026-05-29T09:40:38Z","snapshot_observed_at":"2026-08-03T04:00:50.272221Z","submitted_at":"2026-05-29T09:40:38Z","title":"Contribution Weights: A Geometrical Analysis of Self-Attention Transformers","version":1},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-06-28T23:29:02.457697Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2606.07604"},"observation_digest":"sha256:ac26454fa81d76d210ca7d22125674002348ce2c671b1d42869b6c74efcf7ba0","observation_id":"deb35f06-6355-4517-a654-b688b7971bd0","resolution":{"observed_at":"2026-06-28T23:32:46.637432Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2607.06519","last_updated":"2026-07-07T17:26:28Z","snapshot_observed_at":"2026-08-16T23:20:51.474110Z","submitted_at":"2026-07-07T17:26:28Z","title":"FreqDepthKV: Frequency-Guided Depth Sharing for Robust KV Cache Compression in Long-Context LLM Inference","version":1},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-07-11T00:12:13.830917Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.06519"},"observation_digest":"sha256:7d1c2d68aa7eb8feb2d5597544ea23885d0f7f5167c36a85805e50e03afab352","observation_id":"d2d90e3c-333c-481d-9d6c-ac69050bca9d","resolution":{"observed_at":"2026-07-11T00:17:46.087572Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":"2411.13676","doi":"10.48550/arxiv.2411.13676","metadata_source":"pith","pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Hymba: A hybrid-head architecture for small language models","venue":"cs.CL","work_id":"283d6d50-8219-44e7-94e7-eb6b8673dec7","year":2024},"citing_paper":{"arxiv_id":"2607.06523","last_updated":"2026-07-07T17:29:01Z","snapshot_observed_at":"2026-08-12T20:33:37.072668Z","submitted_at":"2026-07-07T17:29:01Z","title":"DepthWeave-KV: Token-Adaptive Cross-Layer Residual Factorization for Long-Context KV Cache Compression","version":1},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-07-08T03:07:23.648382Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.06523"},"observation_digest":"sha256:1c5b8d34978dcb8ed0872c3dc808316e2252c69a19fd7b6d24ea4138c60fb6ed","observation_id":"01e24ed9-e8bc-4d5b-b6bb-4b998673ba42","resolution":{"observed_at":"2026-07-08T03:14:31.609923Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T18:19:58.783393+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-02T06:39:21.267463Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-17T02:39:45.759545Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T06:39:21.267463Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:5d4a475c611e5584732655a9c93ea027ac0d8a9da41bd72b6ac26231d7bcac06","observation_id":"d8c53253-2a75-4048-a577-8758951f92c0","resolution":{"observed_at":"2026-08-02T06:39:21.267463Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-03T02:03:22.922600Z","title":"Hymba: A hybrid-head architecture for small language models.arXiv preprint arXiv:2411.13676, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14144","last_updated":"2026-07-31T05:37:48Z","snapshot_observed_at":"2026-08-17T02:39:45.759545Z","submitted_at":"2026-07-14T05:52:12Z","title":"The Capability Convergence Hypothesis: Capability from Access Structure, Not Scale","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T02:03:22.922600Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.14144"},"observation_digest":"sha256:8306a903e2f3b055cfffb4686b73e714a7f990dc98ab7f35f779cd187b55754c","observation_id":"ac2f0a18-6a03-484b-8ddc-19bca428c2da","resolution":{"observed_at":"2026-08-03T02:03:22.922600Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-01T03:02:03.507389Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.25271","last_updated":"2026-07-28T04:18:49Z","snapshot_observed_at":"2026-08-13T02:12:02.677620Z","submitted_at":"2026-07-28T04:18:49Z","title":"Bridging Compute- and Data-Optimal Pretraining","version":1},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-01T03:02:03.507389Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.25271"},"observation_digest":"sha256:61fc8cd0f6d4032ff9a26697bc73db1446a19b6730dabdd1ced97bb5ff8b3646","observation_id":"79aaefee-9a18-4600-b590-70c339f69543","resolution":{"observed_at":"2026-08-01T03:02:03.507389Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13676","snapshot_observed_at":"2026-08-01T02:37:54.543725Z","title":"Hymba: A hybrid-head architecture for small language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.25380","last_updated":"2026-07-28T07:34:53Z","snapshot_observed_at":"2026-08-13T04:02:20.179238Z","submitted_at":"2026-07-28T07:34:53Z","title":"Memory for Large Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-01T02:37:54.543725Z"},"links":{"cited_paper":"/paper/2411.13676","citing_paper":"/paper/2607.25380"},"observation_digest":"sha256:8facb042b353c6ee332bab16922a0b4dae05a92569811497921073fd1fbac24e","observation_id":"5b4b4e78-9383-48ee-aba3-01b541d41ce0","resolution":{"observed_at":"2026-08-01T02:37:54.543725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.13676/citation-record","integrity":"/paper/2411.13676/integrity","json":"/paper/2411.13676/citation-record.json","paper":"/paper/2411.13676"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.284974Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.284974Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:55d5dccc1df47f3a89d242c2ea7b830d8b7fbcc6fea49d3b6ee5a27414aa7749","observation_id":"680b0417-8773-43a0-8e7f-9b09b3a7a5ef","resolution":{"observed_at":"2026-08-12T16:20:32.284974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-12T16:20:32.291392Z","title":"Mamba: Linear-time se- quence modeling with selective state spaces.arXiv preprint arXiv:2312.00752, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.291392Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b5566aada3b4b06d4fffcdeb8cbd4d946a8ea1d84226d4b8bf92a3abba3a48a8","observation_id":"b7babe13-0db6-457e-82c4-2e552c45e11a","resolution":{"observed_at":"2026-08-12T16:20:32.291392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-12T16:20:32.296885Z","title":"Transformers are ssms: Generalized models and efficient algorithms through structured state space duality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.296885Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:edbdf7afe41852fa65984d0c1757d61d83c8984d1cdea62ed91fe11a4e2acbfe","observation_id":"89b6ad65-3af9-477f-a3ac-e7c287dcefb3","resolution":{"observed_at":"2026-08-12T16:20:32.296885Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-12T16:20:32.302339Z","title":"Anempiricalstudyofmamba-based language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.302339Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:82797dbf4d40c18672f5f202935448b671722b9b5299f769e96bd3b2490d578e","observation_id":"b6e571fe-5d20-44ee-849c-cfb101d740c9","resolution":{"observed_at":"2026-08-12T16:20:32.302339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18668","last_updated":"2025-03-07T18:57:52Z","snapshot_observed_at":"2026-08-16T14:14:23.399336Z","submitted_at":"2024-02-28T19:28:27Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18668","snapshot_observed_at":"2026-08-12T16:20:32.309050Z","title":"Simple linear attention language models balance the recall-throughput tradeoff","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.309050Z"},"links":{"cited_paper":"/paper/2402.18668","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:273b6f206c24c9ade2a7e33da69ebc876cefe9dc3b193e6fdb31e3c69bbe948f","observation_id":"ccac880c-419a-4823-9a74-99cfa328a5ef","resolution":{"observed_at":"2026-08-12T16:20:32.309050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-12T16:20:32.314399Z","title":"Jamba: A hybrid transformer-mamba language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.314399Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:e15f79e510437a50e0b5d3d015bf7df5ddf836a6d7e34e3369db3bb1e6108f8e","observation_id":"365e0b9a-e682-4f90-99ec-adb327a270a4","resolution":{"observed_at":"2026-08-12T16:20:32.314399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07522","last_updated":"2025-02-28T02:20:49Z","snapshot_observed_at":"2026-08-16T13:44:03.977685Z","submitted_at":"2024-06-11T17:50:51Z","title":"Samba: Simple Hybrid State Space Models for Efficient Unlimited Context Language Modeling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07522","snapshot_observed_at":"2026-08-12T16:20:32.321340Z","title":"Samba: Simple hy- brid state space models for efficient unlimited context language modeling.arXiv preprint arXiv:2406.07522, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.321340Z"},"links":{"cited_paper":"/paper/2406.07522","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:fef342930354c3f307b1a92a11f2516df5e5c5d41984652e86dc3043b690a292","observation_id":"36a6edb2-9ea8-40f7-8f2a-0ad9df9c4855","resolution":{"observed_at":"2026-08-12T16:20:32.321340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.327340Z","title":"Quantizable transformers: Removing outliers by helping attention heads do nothing.Ad- vances in Neural Information Processing Systems, 36:75067–75096, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.327340Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:667548ed28ff1f55647a766d094123a8216158a407c175e3ac0f5a07109be2a2","observation_id":"1eab19ac-ab9f-458d-ae84-d9f07161d8e0","resolution":{"observed_at":"2026-08-12T16:20:32.327340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.332796Z","title":"Attention is off by one","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.332796Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:15e74c15e4d187c791adec0fb4d680a7762484920d141c272a6a00b9551da5c5","observation_id":"d6f7b289-1374-4bd3-a17f-466c8f3a51eb","resolution":{"observed_at":"2026-08-12T16:20:32.332796Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-08-14T06:01:54.549199Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-12T16:20:32.337908Z","title":"Efficient streaming lan- guage models with attention sinks.arXiv preprint arXiv:2309.17453, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.337908Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:4cf75c609ad19b28ea0c1c339378778da47854c1575fd541449e6ec0c528d935","observation_id":"f8d69819-4e30-42c2-9f5e-cb8f74ce3df0","resolution":{"observed_at":"2026-08-12T16:20:32.337908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12981","last_updated":"2024-05-21T17:59:29Z","snapshot_observed_at":"2026-08-16T13:50:52.495994Z","submitted_at":"2024-05-21T17:59:29Z","title":"Reducing Transformer Key-Value Cache Size with Cross-Layer Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.12981","snapshot_observed_at":"2026-08-12T16:20:32.344744Z","title":"Reducing transformer key-value cache size with cross-layer attention","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.344744Z"},"links":{"cited_paper":"/paper/2405.12981","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:2fc899310964984732b74ac533db6c1acf199c38ef7f60f602aa2d4877b4121b","observation_id":"baa5f6ec-1d50-4f0b-9471-2fe7120524d9","resolution":{"observed_at":"2026-08-12T16:20:32.344744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.351411Z","title":"Direct preference optimization: Your language model is secretly a reward model.Advances in Neural Information Processing Systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.351411Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:c002c1f4034d8fa5b537cb13dbfd938d7e65b1eed4d28654b5ed2f46ff54d4f4","observation_id":"1ad8a78a-1823-43bd-9217-9601d3c26c4f","resolution":{"observed_at":"2026-08-12T16:20:32.351411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.357034Z","title":"Dora: Weight- decomposed low-rank adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.357034Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:7a112437c1d8b963dbfde41ab5d9e7efb80742e15193a89ae8aefc439b60d599","observation_id":"cf706014-e8d5-4e99-b15d-8b48e360f942","resolution":{"observed_at":"2026-08-12T16:20:32.357034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00746","last_updated":"2024-06-18T13:08:24Z","snapshot_observed_at":"2026-08-16T17:50:12.347206Z","submitted_at":"2023-10-01T17:52:59Z","title":"RoleLLM: Benchmarking, Eliciting, and Enhancing Role-Playing Abilities of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00746","snapshot_observed_at":"2026-08-12T16:20:32.362269Z","title":"Rolellm: Benchmarking, eliciting, and enhanc- ing role-playing abilities of large language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.362269Z"},"links":{"cited_paper":"/paper/2310.00746","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:345d8fc3c4fcf7b7c63a6c92e04f9cc93f301b07c57a4d70323a00dc735ee0c4","observation_id":"cd50ac20-f563-4bda-b000-3d2fb9916443","resolution":{"observed_at":"2026-08-12T16:20:32.362269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01032","last_updated":"2024-06-03T22:22:15Z","snapshot_observed_at":"2026-08-16T14:22:19.962526Z","submitted_at":"2024-02-01T21:44:11Z","title":"Repeat After Me: Transformers are Better than State Space Models at Copying","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01032","snapshot_observed_at":"2026-08-12T16:20:32.368162Z","title":"Repeat after me: Trans- formers are better than state space models at copying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.368162Z"},"links":{"cited_paper":"/paper/2402.01032","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d9618ced67504f3ce0ad134549f82587877dd0ecd4abae8fb2acb4f60b6cc3ba","observation_id":"0e9bd003-c636-4f45-b859-121c1be6fdf6","resolution":{"observed_at":"2026-08-12T16:20:32.368162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.373999Z","title":"Decimamba: Exploring the length extrapolation potential of mamba, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.373999Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:16baf62e91b89a7c959bd2717d052fb3f02567696778ab4a5ed36ab48b4328b4","observation_id":"7131e50a-bb25-4aa6-83ab-f318ddd29d06","resolution":{"observed_at":"2026-08-12T16:20:32.373999Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16712","last_updated":"2024-05-26T22:23:02Z","snapshot_observed_at":"2026-08-18T10:18:01.875999Z","submitted_at":"2024-05-26T22:23:02Z","title":"Zamba: A Compact 7B SSM Hybrid Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16712","snapshot_observed_at":"2026-08-12T16:20:32.379199Z","title":"Zamba: A compact 7b ssm hy- brid model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.379199Z"},"links":{"cited_paper":"/paper/2405.16712","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:861b7b729941c24593286952b07b87bbb481bf20f42f46570a15d7a7a685eee8","observation_id":"0bf35d70-0d9a-4231-82d4-edfbee70b0c8","resolution":{"observed_at":"2026-08-12T16:20:32.379199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19521","last_updated":"2024-05-24T15:06:45Z","snapshot_observed_at":"2026-08-16T14:05:28.692156Z","submitted_at":"2024-03-28T15:54:59Z","title":"Interpreting Key Mechanisms of Factual Recall in Transformer-Based Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19521","snapshot_observed_at":"2026-08-12T16:20:32.384743Z","title":"Interpreting key mechanisms of factual recall in transformer-based language models.arXiv preprint arXiv:2403.19521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.384743Z"},"links":{"cited_paper":"/paper/2403.19521","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:bb25643d44ccca6691588e7415083585042d01ccfe2e4485214659031e4a033b","observation_id":"abd1283e-8c31-433e-8508-0dd2500a3c4d","resolution":{"observed_at":"2026-08-12T16:20:32.384743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.09519","last_updated":"2025-05-08T21:25:08Z","snapshot_observed_at":"2026-08-16T13:43:12.228782Z","submitted_at":"2024-06-13T18:12:01Z","title":"Talking Heads: Understanding Inter-layer Communication in Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.09519","snapshot_observed_at":"2026-08-12T16:20:32.390532Z","title":"Talking heads: Understanding inter-layer communica- tion in transformer language models.arXiv preprint arXiv:2406.09519, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.390532Z"},"links":{"cited_paper":"/paper/2406.09519","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:af50ff93a1b01a2d3ff81cf796e5359be9fd9dfa7a8f5118cc24117b7690601c","observation_id":"d6726c42-5169-4d68-8ad3-6e22d63dc772","resolution":{"observed_at":"2026-08-12T16:20:32.390532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.01590","last_updated":"2024-03-31T14:31:14Z","snapshot_observed_at":"2026-08-16T14:13:18.547869Z","submitted_at":"2024-03-03T18:58:21Z","title":"The Hidden Attention of Mamba Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.01590","snapshot_observed_at":"2026-08-12T16:20:32.396513Z","title":"The hidden attention of mamba models.arXiv preprint arXiv:2403.01590, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.396513Z"},"links":{"cited_paper":"/paper/2403.01590","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:5d9b8686b39a79149e1b59da701513872a4a67749ba676f0329b2f57935d6447","observation_id":"d8706e9e-2cf8-4435-8259-39f7b32885db","resolution":{"observed_at":"2026-08-12T16:20:32.396513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.402349Z","title":"Hellaswag: Can a machine really finish your sentence? InProceedings of the 57th Annual Meeting of the Association for Computational Linguistics, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.402349Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:87bc53a156496ab94c95463e8b9f7cfc7f005e402728f3141b3523245511f09b","observation_id":"ff8cedd4-32ed-4362-bb4e-110aeabb4438","resolution":{"observed_at":"2026-08-12T16:20:32.402349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-12T16:20:32.407666Z","title":"Longformer: The long-document transformer.arXiv preprint arXiv:2004.05150, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.407666Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d83be9f1e36c918dd2ecdafac18e1773cab82c8ae4b97e1c79d2b3afaea760ed","observation_id":"ec508037-f6d4-41a1-b849-9ac4e6e33d87","resolution":{"observed_at":"2026-08-12T16:20:32.407666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14366","last_updated":"2024-09-07T02:52:29Z","snapshot_observed_at":"2026-08-18T11:14:01.928809Z","submitted_at":"2024-05-23T09:43:52Z","title":"MiniCache: KV Cache Compression in Depth Dimension for Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14366","snapshot_observed_at":"2026-08-12T16:20:32.412901Z","title":"Minicache: Kv cache compression in depth dimension for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.412901Z"},"links":{"cited_paper":"/paper/2405.14366","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:4bbe0958bce0f730553a48a5f86f40e2e99ebaae75de744990cb008eebf75167","observation_id":"a54f002f-c183-4e53-88e0-19641b7e1091","resolution":{"observed_at":"2026-08-12T16:20:32.412901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.418068Z","title":"SQuAD: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.418068Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b636268fde659be89b4d0f7d75bc1586018df291b15904aa172d76d24267b7fd","observation_id":"616dfada-358d-4b3c-9072-8de28a846d50","resolution":{"observed_at":"2026-08-12T16:20:32.418068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-12T16:20:32.423182Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.423182Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:2107a7656cb794beb50928f0b3ca6e05ab15c745c91b18f05973ea83972510d2","observation_id":"88ab6c05-250c-437a-a1af-02dbdfa49a68","resolution":{"observed_at":"2026-08-12T16:20:32.423182Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.429431Z","title":"Codeparrot/github-code · datasets at hugging face","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.429431Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:00fa0f5402f67a1187d20d18279d6b7b8d3124927f36980dfdb698bb3133d248","observation_id":"1330a48e-f9b6-4671-b370-e0fb58ba821d","resolution":{"observed_at":"2026-08-12T16:20:32.429431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.434742Z","title":"Lm-infinite: Zero-shot extreme length generalization for large lan- guage models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.434742Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:65339e863875baadf3be98dce4278e7242d04304671a6842087ec099dc5cb6f6","observation_id":"19db1aa1-d488-4222-b898-838bd9e87b48","resolution":{"observed_at":"2026-08-12T16:20:32.434742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.439564Z","title":"A framework for few-shot language model evaluation, 12 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.439564Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:0e8b12927456c44d3cd9b95c833294add78ea06c4b3e56f53374fa0583080989","observation_id":"c68a54bb-3d63-4a46-81c4-53fda8165f8b","resolution":{"observed_at":"2026-08-12T16:20:32.439564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.444967Z","title":"Simple lin- ear attention language models balance the recall- throughput tradeoff, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.444967Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:cfe998dd10d1a0497bdaaa975909cacdf811b78cf0328d4c4842db98d69714ba","observation_id":"2bbaa4bd-2308-4c11-ad31-97bc5337a56e","resolution":{"observed_at":"2026-08-12T16:20:32.444967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-07T09:40:32.614733Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16588","snapshot_observed_at":"2026-08-12T16:20:32.451809Z","title":"Vision transformers need registers","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.451809Z"},"links":{"cited_paper":"/paper/2309.16588","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:1ff8141a25ca12cb5ae06616c91707c1b15703752198ec414bee077720e553ab","observation_id":"90ff8672-6050-444f-8575-294829ebe974","resolution":{"observed_at":"2026-08-12T16:20:32.451809Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.457365Z","title":"Attention if off by one, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.457365Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:a3b55436ceeb1904024dbf45e7a6d423506981ddb0c9740573e4c280a9685951","observation_id":"56be0203-c52e-44a3-81e0-d720192ebaa3","resolution":{"observed_at":"2026-08-12T16:20:32.457365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08691","last_updated":"2021-09-02T17:34:41Z","snapshot_observed_at":"2026-08-16T20:01:36.160048Z","submitted_at":"2021-04-18T03:19:26Z","title":"The Power of Scale for Parameter-Efficient Prompt Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08691","snapshot_observed_at":"2026-08-12T16:20:32.463210Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.463210Z"},"links":{"cited_paper":"/paper/2104.08691","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:752ef746c31922d61069dd5033bab5b588261cacc37356afc3aa03580f9b49ba","observation_id":"fc87f738-bec5-4b84-9cce-ced81552c1d1","resolution":{"observed_at":"2026-08-12T16:20:32.463210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.04332","last_updated":"2022-03-14T02:05:06Z","snapshot_observed_at":"2026-08-16T17:57:46.873698Z","submitted_at":"2021-09-09T15:11:04Z","title":"PPT: Pre-trained Prompt Tuning for Few-shot Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.04332","snapshot_observed_at":"2026-08-12T16:20:32.469793Z","title":"Ppt: Pre-trained prompt tuning for few-shot learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.469793Z"},"links":{"cited_paper":"/paper/2109.04332","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b93a8517192e448769701d799f56b0a344b1025f0a2c74da214193d4dedd4935","observation_id":"4a05abdf-034d-4bee-9039-8037ad9f7cac","resolution":{"observed_at":"2026-08-12T16:20:32.469793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.475413Z","title":"The Adventures of Oliver Twist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.475413Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:3f05ac20d2fcac82fbebac2252091adb12dbd53c5acf4647650254dcea0138db","observation_id":"7c9000d7-3e32-42df-96a3-42a970f93439","resolution":{"observed_at":"2026-08-12T16:20:32.475413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.16504","last_updated":"2024-10-18T12:20:11Z","snapshot_observed_at":"2026-08-18T18:29:33.580277Z","submitted_at":"2024-05-26T09:57:45Z","title":"Explaining Modern Gated-Linear RNNs via a Unified Implicit Attention Formulation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.16504","snapshot_observed_at":"2026-08-12T16:20:32.480631Z","title":"A unified implicit attention formulation for gated- linear recurrent sequence models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.480631Z"},"links":{"cited_paper":"/paper/2405.16504","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:aaa939c9572aad82ffc956d1f9bac522075804b17d94ef1e77f848163ff02a88","observation_id":"3061283c-4d28-4fd3-9414-6f5b291602c8","resolution":{"observed_at":"2026-08-12T16:20:32.480631Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.487084Z","title":"Dimakis, Yair Carmon, Achal Dave, Ludwig Schmidt, and Vaishaal Shankar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.487084Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:0a6404e0753ceb6ee599265ad7efa2b31aa6c789d9358a5b3b8748cced19063b","observation_id":"ab30e457-35f0-4c87-ac38-b0664f91c465","resolution":{"observed_at":"2026-08-12T16:20:32.487084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.491936Z","title":"Smollm-corpus, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.491936Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:46367843e0fab597616408ba15ebc390a0ab186dc2a6ca98186c7f6b7f68ae4d","observation_id":"cae4d716-681c-43bd-8289-73cc594b3cfa","resolution":{"observed_at":"2026-08-12T16:20:32.491936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.06395","last_updated":"2024-06-03T08:54:38Z","snapshot_observed_at":"2026-08-12T13:10:06.472493Z","submitted_at":"2024-04-09T15:36:50Z","title":"MiniCPM: Unveiling the Potential of Small Language Models with Scalable Training Strategies","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.06395","snapshot_observed_at":"2026-08-12T16:20:32.496829Z","title":"Minicpm: Unveiling the potential of small language models with scalable training strategies","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.496829Z"},"links":{"cited_paper":"/paper/2404.06395","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:604cc4544df54cfa8e85c1ebb651f4df47a87660a174bdd2037039e9d2a7804d","observation_id":"caf31356-346a-43a1-8f23-506738118c19","resolution":{"observed_at":"2026-08-12T16:20:32.496829Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-12T16:20:32.501507Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.501507Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:70c5a27512334deff0a7e50fede9da1bd79ae1a80b0a80b7407f46b1530b159d","observation_id":"b5d9d355-6f37-489e-be80-50920c2dc077","resolution":{"observed_at":"2026-08-12T16:20:32.501507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07413","last_updated":"2024-04-11T00:52:39Z","snapshot_observed_at":"2026-08-16T14:01:54.431970Z","submitted_at":"2024-04-11T00:52:39Z","title":"JetMoE: Reaching Llama2 Performance with 0.1M Dollars","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07413","snapshot_observed_at":"2026-08-12T16:20:32.506393Z","title":"Jetmoe: Reaching llama2 performance with 0.1 m dollars","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.506393Z"},"links":{"cited_paper":"/paper/2404.07413","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b80630186c1a642ad6d4ac5510a5975af38d0fa3a4af4eb9688efc3ba5861dd8","observation_id":"296da1dc-63fe-4361-af32-02859fd87607","resolution":{"observed_at":"2026-08-12T16:20:32.506393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.513029Z","title":"Dynamically scaled rope further increases per- formance of long context llama with zero finetuning, July 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.513029Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:452782ceed41ba68f94826845e94a12698780f4f804ae4ffde9ed53152de34e0","observation_id":"3df9b504-4256-49ef-879d-38694bac4cb1","resolution":{"observed_at":"2026-08-12T16:20:32.513029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.518667Z","title":"Llama 3.2: Revolutionizing edge AI and vision with open, customizable models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.518667Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:04a1d4ccd7bdd0e09bb1496808a3bb5e375d724e2a26108b672fbfab89cbab21","observation_id":"a0d2a8e5-58a7-4721-86c3-cd51d1d08bfa","resolution":{"observed_at":"2026-08-12T16:20:32.518667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.523538Z","title":"Smollm - blazingly fast and remarkably powerful, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.523538Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:47d4b63b8c6e326b6fb67335ba85e52cd4cd8ae8ec017f30070148efa74ccc5a","observation_id":"05674b16-12c6-4989-90b2-3bc14d7d68d4","resolution":{"observed_at":"2026-08-12T16:20:32.523538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.528148Z","title":"Smollm2 - with great data, comes great performance, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.528148Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:cecfa7cd41a5a83bef4519b57abb60e5610aeb608595a55b236d646c2e871678","observation_id":"1ceef134-b3aa-44cc-bede-2b90a580dda4","resolution":{"observed_at":"2026-08-12T16:20:32.528148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.532645Z","title":"Amd-olmo: A series of 1b language models trained from scratch by amd on amd instinct™ mi250 gpus., October 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.532645Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:97819dba817148cfd4bf2d4d4dd2a146de5a8c3ae130878832af1b0bb02bc6fb","observation_id":"fbcb8e86-336d-4f74-8260-ca0adc84773a","resolution":{"observed_at":"2026-08-12T16:20:32.532645Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.17834","last_updated":"2024-02-27T19:00:07Z","snapshot_observed_at":"2026-08-16T14:14:46.903233Z","submitted_at":"2024-02-27T19:00:07Z","title":"Stable LM 2 1.6B Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.17834","snapshot_observed_at":"2026-08-12T16:20:32.537094Z","title":"Stable lm 2 1.6 b tech- nical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.537094Z"},"links":{"cited_paper":"/paper/2402.17834","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:f496df2fefa9a3666cc97feae12025ddab1a1adffa921ef01d5e60534be98069","observation_id":"e3896155-8905-435a-9ee9-1aea20503140","resolution":{"observed_at":"2026-08-12T16:20:32.537094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.542119Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.542119Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:1e95139c417c83b39041e7511e5f8ac4bf07a70e2ecffb36ba96fb4782018d7c","observation_id":"4e6c3d94-b939-42ac-98bb-d7d51d4ec30d","resolution":{"observed_at":"2026-08-12T16:20:32.542119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.547512Z","title":"HuggingFaceTB/cosmo-1b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.547512Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:1902c5c168b7a03c569a8a1a0050a4aa52860331fc5c16ee16ae6f0c32796a48","observation_id":"be1b41a3-91d5-4def-997e-10f0fa9990c9","resolution":{"observed_at":"2026-08-12T16:20:32.547512Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05463","last_updated":"2023-09-11T14:01:45Z","snapshot_observed_at":"2026-08-02T22:47:03.212781Z","submitted_at":"2023-09-11T14:01:45Z","title":"Textbooks Are All You Need II: phi-1.5 technical report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.05463","snapshot_observed_at":"2026-08-12T16:20:32.553121Z","title":"Textbooks are all you need ii: phi-1.5 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.553121Z"},"links":{"cited_paper":"/paper/2309.05463","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:86b765b7d301c40641b87125e266d579cce0699a7805d04bc5ea03169d5f9f63","observation_id":"b37f3336-fccb-4338-b0c2-fb463294b7c4","resolution":{"observed_at":"2026-08-12T16:20:32.553121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.16818","last_updated":"2024-04-15T17:58:01Z","snapshot_observed_at":"2026-08-16T14:23:21.114682Z","submitted_at":"2024-01-30T08:45:08Z","title":"H2O-Danube-1.8B Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.16818","snapshot_observed_at":"2026-08-12T16:20:32.559404Z","title":"H2o-danube-1.8 b technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.559404Z"},"links":{"cited_paper":"/paper/2401.16818","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:5ca809eb826bc09d5f19dc9ecb9065d4ebb1baa825322feabf69a7fb9b7fd371","observation_id":"033b67d2-727e-4f18-a939-b2ea0cd480fd","resolution":{"observed_at":"2026-08-12T16:20:32.559404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.600629Z","title":"Openelm: An efficient language model family with open training and infer- ence framework","venue":null,"work_id":"84e7031c-3cd6-4543-bc04-3c728197002a","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.564734Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:bf892f133574e24a646d3d00ac780b1a544e0383af103315af59306d542b2867","observation_id":"0413a501-64b7-4ce5-8b63-038f12d9bb01","resolution":{"observed_at":"2026-08-12T16:20:34.605592Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.584392Z","title":"The On-Device Intelligence Update","venue":null,"work_id":"d53a5f5e-3513-458e-aaee-0986d9f532e0","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.569423Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:0495c1e0ce48b03e602466a5eb4b8e8fa01f9b4ade2b82b91d874de74213e651","observation_id":"46161be2-7e94-47eb-81a3-a9a7b49db430","resolution":{"observed_at":"2026-08-12T16:20:34.589797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.568562Z","title":"Introducing Meta Llama 3: The most capable openly available LLM to date","venue":null,"work_id":"79282bf5-8a24-4463-bf7d-1b6b2f625b56","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.574279Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:9e7b38c6e969afe9fb35de3334199923ca65d52e5b938df8a68f36331de9627e","observation_id":"5f05db3c-05b3-4b1e-8d73-52bf3addbfe6","resolution":{"observed_at":"2026-08-12T16:20:34.573954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.550409Z","title":"The fineweb datasets: Decanting the web for the finest text data at scale, 2024","venue":null,"work_id":"20e61bfa-73e0-4c18-a66f-174f46eeee62","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.578717Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d38fbf1a208c36039af212c68831d97ead1f2b572c7c3b0f4bed73ddfc0340a4","observation_id":"15cd0a8d-46ce-4adb-8f68-8c6f1be10571","resolution":{"observed_at":"2026-08-12T16:20:34.556144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.532499Z","title":"OpenCeres: When open information extrac- tion meets the semi-structured web","venue":null,"work_id":"d707d6b0-9763-47e5-8263-e73de8aa50f1","year":2019},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.583890Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:44bb712de36cb435c87410d6cb48700e752c6128cb9778692bdaf3e01e0e2c95","observation_id":"f0af0be5-a3eb-465b-b186-2cb0ece0b238","resolution":{"observed_at":"2026-08-12T16:20:34.537885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.514352Z","title":"Know what you don’t know: Unanswerable questions for squad, 2018","venue":null,"work_id":"9d636cb0-8441-4a43-9ace-30a0f3930a78","year":2018},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.589064Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d900fc5a3660c424c5c768f80b5007a9b4ca99060be644137d9371ed705361fd","observation_id":"5ecc7b57-4cab-466a-b602-4555974fedff","resolution":{"observed_at":"2026-08-12T16:20:34.519467Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05209","last_updated":"2024-03-13T08:14:47Z","snapshot_observed_at":"2026-08-17T04:39:06.769492Z","submitted_at":"2023-10-08T15:50:36Z","title":"Scaling Laws of RoPE-based Extrapolation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05209","snapshot_observed_at":"2026-08-12T16:20:32.594000Z","title":"Scaling laws of rope-based extrapolation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.594000Z"},"links":{"cited_paper":"/paper/2310.05209","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:16ecc04bf7929fd098234a3238de7fa74f54783c346e2a1ffad211ba28d82c35","observation_id":"0645f9af-d932-463c-9387-0862a26e8a30","resolution":{"observed_at":"2026-08-12T16:20:32.594000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.00071","last_updated":"2026-02-06T19:40:50Z","snapshot_observed_at":"2026-08-18T09:44:25.224559Z","submitted_at":"2023-08-31T18:18:07Z","title":"YaRN: Efficient Context Window Extension of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.00071","snapshot_observed_at":"2026-08-12T16:20:32.599060Z","title":"Yarn: Efficient context window extension of large language models.arXiv preprint arXiv:2309.00071, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.599060Z"},"links":{"cited_paper":"/paper/2309.00071","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:284c9e58fa5e14a147858b06941ea3394799710e8712b97b8834d710f6595a2c","observation_id":"b32b6aa2-5522-4e9c-9d22-54a4c927d5c1","resolution":{"observed_at":"2026-08-12T16:20:32.599060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.497908Z","title":"Inf bench: Extend- ing long context evaluation beyond 100k tokens","venue":null,"work_id":"eba0397f-e7d7-4409-bda0-a26b4a718726","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.604969Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:9d4dfdf9e41410aa5dde51848d89588238d8b01c7deb6e6c7bbf76459010116c","observation_id":"e016935e-bac5-493b-a86e-0ac1c4da9bef","resolution":{"observed_at":"2026-08-12T16:20:34.503186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.478006Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":"a72b285e-34be-441f-81da-ca2fdcb5ce65","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.609923Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:858055aba85fff55db17fa2a6e675a871b76b75baa1d357c60e0e54b83d50a0d","observation_id":"31c78362-9544-490e-8e41-50254e2057c0","resolution":{"observed_at":"2026-08-12T16:20:34.483400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.16944","last_updated":"2023-10-25T19:25:16Z","snapshot_observed_at":"2026-08-18T22:05:54.705341Z","submitted_at":"2023-10-25T19:25:16Z","title":"Zephyr: Direct Distillation of LM Alignment","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.16944","snapshot_observed_at":"2026-08-12T16:20:32.614443Z","title":"Zephyr: Di- rect distillation of lm alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.614443Z"},"links":{"cited_paper":"/paper/2310.16944","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:518f4a316eae9ee26d5672a0e5ab15f0b15c7e9c3f9215f82b34fe9c7ffe37c4","observation_id":"53dd1e57-cae1-4b27-8e87-721fafa76a15","resolution":{"observed_at":"2026-08-12T16:20:32.614443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.460278Z","title":"Lmflow: An extensible toolkit for finetuning and inference of large foundation models","venue":null,"work_id":"523819bc-1617-48b4-8e42-0f3605ee583f","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.619984Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:ba1af42612f4b20c5eade7240f56c8fb49a03d88e3f6ed8430effdb86dc9bf67","observation_id":"2409a0ef-cda0-4394-b326-c54fcc136470","resolution":{"observed_at":"2026-08-12T16:20:34.465379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.07863","last_updated":"2024-11-12T11:18:43Z","snapshot_observed_at":"2026-08-15T18:13:42.319653Z","submitted_at":"2024-05-13T15:50:39Z","title":"RLHF Workflow: From Reward Modeling to Online RLHF","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.07863","snapshot_observed_at":"2026-08-12T16:20:32.624660Z","title":"Rlhf workflow: From reward modeling to online rlhf.arXiv preprint arXiv:2405.07863, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.624660Z"},"links":{"cited_paper":"/paper/2405.07863","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:f97635ec1c5c24a6522cc4f84774e1a3dfaade0f820bf88da47ebe3ab101c6a4","observation_id":"0dcee516-9775-4707-b5fb-406db6415ad2","resolution":{"observed_at":"2026-08-12T16:20:32.624660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.630702Z","title":"Qwen2.5: A party of foundation models, September 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.630702Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:87380aee7603b923eae28622fe640b58c41c76457094551c7b4616aaee4ce114","observation_id":"c642de7c-5d9c-4e4f-a650-22168a54b64c","resolution":{"observed_at":"2026-08-12T16:20:32.630702Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.431151Z","title":"Patil, Ion Stoica, and Joseph E","venue":null,"work_id":"0c4753b4-a8e5-4524-a078-1bc0f4a3a67b","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.636151Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b340b88ccf806c8104dcb98ed9d87517d6fd24ce931ed431c7c769a15c2e0982","observation_id":"64695960-143f-4a5e-9ed5-cd415cdc9296","resolution":{"observed_at":"2026-08-12T16:20:34.437227Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-08-14T18:16:28.847993Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-12T16:20:32.641414Z","title":"Bert: Pre-training of deep bidi- rectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.641414Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:540fe39e46d0b857bce44680c074f0ce42f990d29bc1fd7d46f9deb7e6e26f7e","observation_id":"a3746c78-2e6c-4896-a81b-4d88e5fffe61","resolution":{"observed_at":"2026-08-12T16:20:32.641414Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.414193Z","title":null,"venue":null,"work_id":"99e4f55b-972a-40e4-b48a-d8fd4e3c21c2","year":2020},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.646242Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:44485a30431090eaae1fcf8d69e1084ecaf1b003907925f422edf2bbf7a2dc73","observation_id":"b756f457-6c40-490f-9ee0-57b8af45360a","resolution":{"observed_at":"2026-08-12T16:20:34.419609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.17189","last_updated":"2022-03-31T17:12:13Z","snapshot_observed_at":"2026-08-16T17:10:11.301337Z","submitted_at":"2022-03-31T17:12:13Z","title":"Scaling Up Models and Data with $\\texttt{t5x}$ and $\\texttt{seqio}$","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.17189","snapshot_observed_at":"2026-08-12T16:20:32.651174Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.651174Z"},"links":{"cited_paper":"/paper/2203.17189","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:23e3426e6d57691063d802bfac53be0c812da03a856ed3ae25a78d34d09e682b","observation_id":"772127fc-d81c-482e-a74c-8c86a214e4d9","resolution":{"observed_at":"2026-08-12T16:20:32.651174Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.14995","last_updated":"2024-01-19T07:47:01Z","snapshot_observed_at":"2026-08-16T15:12:45.594763Z","submitted_at":"2023-07-27T16:45:33Z","title":"TransNormerLLM: A Faster and Better Large Language Model with Improved TransNormer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.14995","snapshot_observed_at":"2026-08-12T16:20:32.657559Z","title":"Scaling transnormer to 175 billion parameters.arXiv preprint arXiv:2307.14995, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.657559Z"},"links":{"cited_paper":"/paper/2307.14995","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:8df17ee6c17f4131550b6f4e3a32b07aeacb07101b59c4b1b986110d13d0a7e5","observation_id":"047ad6c2-2cf8-43d1-80bd-7ca9ba659b86","resolution":{"observed_at":"2026-08-12T16:20:32.657559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-12T16:20:32.662525Z","title":"Scaling laws for neural language models","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.662525Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:5f486474b9dcb93bb191c0f69fc2213b16c0248df3899f0c785fb660d45b3a40","observation_id":"9724b39c-ef0b-4e9d-8b6c-615ab811ea0d","resolution":{"observed_at":"2026-08-12T16:20:32.662525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.393878Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":"5c9108f3-c4e7-4b89-a0fe-6145342bae75","year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.667530Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:2ce122b194f4578aad6b1ba359b9f3c651880d1344ebf4dea8fb769170dfc5b8","observation_id":"1368313a-1517-4bd9-8dbc-342565407ef3","resolution":{"observed_at":"2026-08-12T16:20:34.399440Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-08-16T18:37:57.151597Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-12T16:20:32.674221Z","title":"Glm: General language model pretraining with autoregres- sive blank infilling.arXiv preprint arXiv:2103.10360, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.674221Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:57f66e1349a8b86c985e3cf0d604af96852ceacdf0ed56ca8a89e4a0c38a5d1e","observation_id":"24de5703-f677-42d0-a3f8-0c4e18948c10","resolution":{"observed_at":"2026-08-12T16:20:32.674221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-12T16:20:32.681439Z","title":"Opt: Open pre-trained transformer language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.681439Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:0de9d8642ac4a33f2df89807415ec5a606c5aae4b14a08811467972ee4991696","observation_id":"d38f3495-d6c1-404e-894e-47dc525869ea","resolution":{"observed_at":"2026-08-12T16:20:32.681439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-12T16:20:32.687367Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.687367Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:16adf35fd5186d1364ff08f1659f198c5684cdf62ea2f4665e1fb2a4183a6070","observation_id":"178da746-bc93-45b6-b9c6-b366210b9a6e","resolution":{"observed_at":"2026-08-12T16:20:32.687367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-12T16:20:32.697912Z","title":"Llama 2: Open foundation and fine- tuned chat models.arXiv preprint arXiv:2307.09288, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.697912Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:45e212d508f9f0ba6f2dd8d6dfc6c825de0563789d6425014354c86e7349c52c","observation_id":"554820f4-fc6b-4b8b-ba72-9e6d399c26ec","resolution":{"observed_at":"2026-08-12T16:20:32.697912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-12T16:20:32.703994Z","title":"Gemma 2: Improv- ing open language models at a practical size.arXiv preprint arXiv:2408.00118, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.703994Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:82280df06b64a379728fd6bd4771a806904f19ca92522926bff5b58fbd46be1f","observation_id":"5c4f27a7-868a-489d-a502-dda45593d24a","resolution":{"observed_at":"2026-08-12T16:20:32.703994Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-12T16:20:32.711332Z","title":"Gpt-4 technical report.arXiv preprint arXiv:2303.08774, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.711332Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b6ff74d9005db83c0c11d6dcf55c593dbcf1356877c1d8fa7240e526add9bb34","observation_id":"ed7d84d0-6053-4dcd-8a16-0f28dc7cabb4","resolution":{"observed_at":"2026-08-12T16:20:32.711332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13048","last_updated":"2023-12-11T03:58:56Z","snapshot_observed_at":"2026-08-17T17:58:38.402665Z","submitted_at":"2023-05-22T13:57:41Z","title":"RWKV: Reinventing RNNs for the Transformer Era","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13048","snapshot_observed_at":"2026-08-12T16:20:32.717475Z","title":"Rwkv: Reinventing rnns for the transformer era","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.717475Z"},"links":{"cited_paper":"/paper/2305.13048","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:79dab5d952fcd503fe59a797a22148a5f8c1a6e9d31e6f9ca178e1c2e44e44db","observation_id":"2738873a-0eeb-4cfb-bde8-7bdcc9a3f562","resolution":{"observed_at":"2026-08-12T16:20:32.717475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08621","last_updated":"2023-08-09T08:53:08Z","snapshot_observed_at":"2026-08-18T21:18:20.077927Z","submitted_at":"2023-07-17T16:40:01Z","title":"Retentive Network: A Successor to Transformer for Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08621","snapshot_observed_at":"2026-08-12T16:20:32.723486Z","title":"Retentive network: A successor to trans- former for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.723486Z"},"links":{"cited_paper":"/paper/2307.08621","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:cad3cff904bdca422d5cbbf29642b8606d218677d770e00ab9e793f14e9fe174","observation_id":"5700e08d-826e-4db2-b63f-f7907257b64c","resolution":{"observed_at":"2026-08-12T16:20:32.723486Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06635","last_updated":"2024-08-27T01:27:29Z","snapshot_observed_at":"2026-08-17T21:47:46.144942Z","submitted_at":"2023-12-11T18:51:59Z","title":"Gated Linear Attention Transformers with Hardware-Efficient Training","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.06635","snapshot_observed_at":"2026-08-12T16:20:32.731248Z","title":"Gated linear attention transformers with hardware-efficient training.arXiv preprint arXiv:2312.06635, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.731248Z"},"links":{"cited_paper":"/paper/2312.06635","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:b15f2578981aedfdd4550a99d4000346b9b9630843872fe571f44c3355ae28e5","observation_id":"6bf116a2-ac4f-44ad-b0c3-78be8e9fcb54","resolution":{"observed_at":"2026-08-12T16:20:32.731248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.375172Z","title":"Transformers are rnns: Fast autoregressive transformers with linear atten- tion","venue":null,"work_id":"2a42d6a1-9ec1-47e7-9b43-c42c88008454","year":2020},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.738147Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:c0c6f571f19d5f687778117ae12e5b7b94086d0680ab636f220e5785ae58f3aa","observation_id":"bfa4a184-e756-450c-8edd-6282fb87788d","resolution":{"observed_at":"2026-08-12T16:20:34.381569Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-12T16:20:32.744134Z","title":"Effi- ciently modeling long sequences with structured state spaces","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.744134Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:e5e711d060bd5902b0b0b961c7da89cccb675a61cffa63fcb3322d14cb4b4caa","observation_id":"7f23ff8e-6b62-4c9d-8e1a-f79088d7ba6a","resolution":{"observed_at":"2026-08-12T16:20:32.744134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:32.749783Z","title":"Combining recurrent, convolutional, and continuous-time models with linear state space layers.Advances in neural information processing systems, 34:572–585, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.749783Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:5c272ece0a094cf1c622753d985ffabdcdfc3b1ea55a2865643a3c785cda124b","observation_id":"ff1bf771-e877-43d0-99c0-003eb8e3e7a8","resolution":{"observed_at":"2026-08-12T16:20:32.749783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04248","last_updated":"2024-04-25T17:01:52Z","snapshot_observed_at":"2026-08-16T14:20:53.387690Z","submitted_at":"2024-02-06T18:56:35Z","title":"Can Mamba Learn How to Learn? A Comparative Study on In-Context Learning Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04248","snapshot_observed_at":"2026-08-12T16:20:32.755868Z","title":"Can mamba learn how to learn? a comparative study on in-context learning tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.755868Z"},"links":{"cited_paper":"/paper/2402.04248","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:5d3bdaed006f6d0a7a9f03b23abfcdad308c5515a028e7151134cff199dc9ca4","observation_id":"427a0b1a-4761-496c-bc1b-3c27e6828253","resolution":{"observed_at":"2026-08-12T16:20:32.755868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19427","last_updated":"2024-02-29T18:24:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T18:24:46Z","title":"Griffin: Mixing Gated Linear Recurrences with Local Attention for Efficient Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19427","snapshot_observed_at":"2026-08-12T16:20:32.762403Z","title":"Griffin: Mixing gated linear recurrences with local attention for efficient language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.762403Z"},"links":{"cited_paper":"/paper/2402.19427","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:bb7665a5f2f6e68791d71c2510954715563dce0733a7b9bc9f0cdb63e6bbe9aa","observation_id":"221fdb52-126f-4b54-bf02-399f2e468f51","resolution":{"observed_at":"2026-08-12T16:20:32.762403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.348486Z","title":"Block- state transformers","venue":null,"work_id":"4126adef-c906-484b-8789-d7212719386b","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.768129Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:99538537ba59afee94e5ac35d5d8dfdad1ff7613641429395b91ebb3f3f7253e","observation_id":"9c15ad46-0b6c-42ef-a3f2-853f11c72e3d","resolution":{"observed_at":"2026-08-12T16:20:34.353639Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.332517Z","title":"Diag- onal state space augmented transformers for speech recognition","venue":null,"work_id":"6dfdf146-6df3-4fed-9fb6-0a99d2523a36","year":2023},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.773195Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d187912a76186eddfc1196a70811fb04b3198db231d18d4645cb36eb2262f9df","observation_id":"1abb3645-4ada-4ffe-9b84-44fbd7aabdc4","resolution":{"observed_at":"2026-08-12T16:20:34.337491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.06484","last_updated":"2025-01-15T10:41:40Z","snapshot_observed_at":"2026-08-16T13:44:27.642787Z","submitted_at":"2024-06-10T17:24:42Z","title":"Parallelizing Linear Transformers with the Delta Rule over Sequence Length","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.06484","snapshot_observed_at":"2026-08-12T16:20:32.778566Z","title":"Parallelizing linear transformers with the delta rule over sequence length.arXiv preprint arXiv:2406.06484, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.778566Z"},"links":{"cited_paper":"/paper/2406.06484","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:9c6fefc43eac2f281eebe0ebbb4c186d1edb7f1fbb043b031102642f055d70db","observation_id":"13209097-82c5-4c4e-a91b-74485a254335","resolution":{"observed_at":"2026-08-12T16:20:32.778566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.11929","last_updated":"2021-06-03T13:08:56Z","snapshot_observed_at":"2026-08-16T09:25:53.087782Z","submitted_at":"2020-10-22T17:55:59Z","title":"An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.11929","snapshot_observed_at":"2026-08-12T16:20:32.785778Z","title":"An image is worth 16x16 words: Transformers for image recognition at scale.arXiv preprint arXiv:2010.11929, 2020","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.785778Z"},"links":{"cited_paper":"/paper/2010.11929","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:6fd3235ba163fa17c3f3896e82b8dc645530f85a5207b9311538580625852f2c","observation_id":"01b40957-50f6-4b34-b5f6-444ab50118ab","resolution":{"observed_at":"2026-08-12T16:20:32.785778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.11527","last_updated":"2021-02-16T08:06:47Z","snapshot_observed_at":"2026-08-15T00:24:04.749279Z","submitted_at":"2020-06-20T09:06:27Z","title":"Memory Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.11527","snapshot_observed_at":"2026-08-12T16:20:32.792479Z","title":"Memory transformer.arXiv preprint arXiv:2006.11527, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.792479Z"},"links":{"cited_paper":"/paper/2006.11527","citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:11c7400a588df84526d222abd796e8042476bf606b1b3e04674e4d3dd8c59a46","observation_id":"ea642133-f126-4478-9e44-bf271734c227","resolution":{"observed_at":"2026-08-12T16:20:32.792479Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5364.5653","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:33.067616Z","title":"A framework for few-shot language model evaluation, 07 2024","venue":null,"work_id":"2704444c-f1e2-45d5-ba50-3d549d90a73f","year":2024},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.798325Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:565b9a8ba863d0d3a128540b6e9bde33ea2af946b6f5d37e1ebe247eb09bd058","observation_id":"d948f96a-c773-4dc5-8c8b-3a17c9314eac","resolution":{"observed_at":"2026-08-12T16:20:33.077400Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.315103Z","title":null,"venue":null,"work_id":"4f874085-833a-49cb-86b0-5fa36630605d","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.803882Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:9a8bbb331f9a1afe2fdcec2702f511ad1488bab798dd103b812a7cb65610c1ab","observation_id":"0f644df1-24e6-4a17-a1c0-472e4ff55e6f","resolution":{"observed_at":"2026-08-12T16:20:34.320092Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.299344Z","title":null,"venue":null,"work_id":"8ae1c6a0-16f9-493d-8c8b-39f375954761","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.809178Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d2d9224648794f177cfb38ee63f9537cbbbeca9f763be0dabe21eee2c91f8ab0","observation_id":"9ea2b237-2054-4c78-bd6b-69498b9596f1","resolution":{"observed_at":"2026-08-12T16:20:34.304626Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.281931Z","title":null,"venue":null,"work_id":"135ccaca-1fdf-411a-83f5-9679b91faecc","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.814570Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:d9b150be0b161130d0e9efae17edb86fc64392d1f3bf8b96c08bb591edc5b97b","observation_id":"a9e769b4-4418-4fb2-9c30-200f13ac80a3","resolution":{"observed_at":"2026-08-12T16:20:34.286627Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.266685Z","title":null,"venue":null,"work_id":"429708dd-2fac-4380-b2d8-74e288b13c2b","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.820863Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:e6b455b553a22285a855ce9e1876ea7e5c92710d89834edc2526fe2a05178282","observation_id":"93b27070-6193-4306-97f8-32226790fcb6","resolution":{"observed_at":"2026-08-12T16:20:34.271386Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.251169Z","title":null,"venue":null,"work_id":"7e88422b-82c8-4fe1-9ce3-3ce915436558","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.825954Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:e4028873e452e708ccf8011e5f723e93fc36caf199932b127fef55b0209243de","observation_id":"c240863e-5391-4c8f-992a-72e7375d71c2","resolution":{"observed_at":"2026-08-12T16:20:34.256058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.235190Z","title":null,"venue":null,"work_id":"e3962b20-ab9d-48aa-bed9-dbaab9da6a22","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.830982Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:c89843de07b5b00559117479896e539e83f7214c7b6d55eadf75811ba5e84848","observation_id":"27524bd6-e83a-4b79-8182-9f5bbb45d8b9","resolution":{"observed_at":"2026-08-12T16:20:34.240168Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.213956Z","title":null,"venue":null,"work_id":"f4d23a63-f72c-40db-9e30-277fb0060993","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.836548Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:14472354ea3570c40fa09c5ae827b4e5c46f59c7fc21114085aab87ef6ef9e74","observation_id":"e177609c-60b2-4ec8-ba05-bfd6d75b6359","resolution":{"observed_at":"2026-08-12T16:20:34.221010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.195318Z","title":null,"venue":null,"work_id":"55a92039-7ae4-434f-a33c-472df66c542a","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.841292Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:bad4c404ad56c9eae82aae30154855deef3422c09188a732e090b60df5621f3b","observation_id":"8146592d-b368-49c7-af4b-0a347ab669e0","resolution":{"observed_at":"2026-08-12T16:20:34.201109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-12T16:20:34.178523Z","title":null,"venue":null,"work_id":"82c81daa-2178-4aba-9513-1ab17afa9aa3","year":null},"citing_paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-12T16:20:32.846517Z"},"links":{"citing_paper":"/paper/2411.13676"},"observation_digest":"sha256:f4cc551085ea10fe857e7807c5ac9309e547fa0fdbd07bd9ee594825490bb31f","observation_id":"a9cd995e-1094-4218-948d-012d8ccbd4df","resolution":{"observed_at":"2026-08-12T16:20:34.183542Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2411.13676","last_updated":"2024-11-20T19:51:25Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-14T20:26:44.533985Z","submitted_at":"2024-11-20T19:51:25Z","title":"Hymba: A Hybrid-head Architecture for Small Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":85,"verified_exact":1,"verified_fuzzy":14},"total_outbound_references":103},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 100 of 103 outbound references and 43 inbound Pith citation observations for arXiv:2411.13676."}