{"as_of":"2026-08-14T20:12:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:093b47c42204fea46f41c44ace60fd3e23e89dc3b04ba56a3aad88bbf9e67522","coverage":[{"denominator":17,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T16:50:02.473697Z","state":"measured"},{"denominator":18,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":18,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T21:20:34.027247Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.17679","snapshot_observed_at":"2026-08-03T21:20:34.027247Z","title":"Characterizing the behavior of training mamba-based state space models on gpus.arXiv preprint arXiv:2508.17679,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2511.15927","last_updated":"2026-07-17T11:40:17Z","snapshot_observed_at":"2026-08-10T19:05:29.876035Z","submitted_at":"2025-11-19T23:23:49Z","title":"DiffuMamba: High-Throughput Diffusion LMs with Mamba Backbone","version":4},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T21:20:34.027247Z"},"links":{"cited_paper":"/paper/2508.17679","citing_paper":"/paper/2511.15927"},"observation_digest":"sha256:6647fe72ed1cbca088630350851b56f96cfda498185918c2f1c4036c1a555358","observation_id":"5b5e4834-e7fa-4450-b62d-2122592db34c","resolution":{"observed_at":"2026-08-03T21:20:34.027247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2508.17679/citation-record","integrity":"/paper/2508.17679/integrity","json":"/paper/2508.17679/citation-record.json","paper":"/paper/2508.17679"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:00.614989Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.614989Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:1e93a29dbc062bc18238914499f87184da45185c37925b215d6b1facf5183a58","observation_id":"b9af813f-ae51-4524-b579-2c2266262273","resolution":{"observed_at":"2026-08-05T16:50:00.614989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-05T16:50:00.724836Z","title":"Dao, ``Flashattention-2: Faster attention with better parallelism and work partitioning,'' arXiv preprint arXiv:2307.08691, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.724836Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:f17fcfa8c718d97feb45fa2c565143317cbf8a58649e4dc1a5d969e89b24e813","observation_id":"92f81c77-0f04-4a7d-b488-97688db6d958","resolution":{"observed_at":"2026-08-05T16:50:00.724836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.852086Z","title":null,"venue":null,"work_id":"4d819813-f90d-4950-8b04-b4a5c0c2ed76","year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.864754Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:8e0f50a64b7e8e17dc5dd2241d3cbb18b954dbc4ce6dcde2f2b42d257e7721a6","observation_id":"7ab62b5b-b1cb-402e-96e8-e7be6b331730","resolution":{"observed_at":"2026-08-05T16:50:04.957336Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T16:50:00.975503Z","title":"Beltagy, M","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:00.975503Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:553ea34e7283ef9cd26a995606bb51c2dabbc5d6d7b4463737ab8a49d9b12c51","observation_id":"e4cb347b-97a7-4c66-a864-af0379ef8ec2","resolution":{"observed_at":"2026-08-05T16:50:00.975503Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.00396","last_updated":"2022-08-05T17:54:38Z","snapshot_observed_at":"2026-08-14T01:02:41.198730Z","submitted_at":"2021-10-31T03:32:18Z","title":"Efficiently Modeling Long Sequences with Structured State Spaces","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.00396","snapshot_observed_at":"2026-08-05T16:50:01.096258Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.096258Z"},"links":{"cited_paper":"/paper/2111.00396","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:91673a8bc5b9cd278974c7fb95bf471f5781885a64a309e9b9f12e6424922170","observation_id":"63f19a92-e4d5-4787-aa64-30d766a834c1","resolution":{"observed_at":"2026-08-05T16:50:01.096258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-05T16:50:01.254754Z","title":"Gu and T","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.254754Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:a913b5528697abec2a51e50c287d71f1c2d92748bfa6ccf166b692cc9fca33be","observation_id":"8f6b34a5-d215-4a07-bf53-1d4d3ff05604","resolution":{"observed_at":"2026-08-05T16:50:01.254754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.21060","last_updated":"2024-05-31T17:50:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-31T17:50:01Z","title":"Transformers are SSMs: Generalized Models and Efficient Algorithms Through Structured State Space Duality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.21060","snapshot_observed_at":"2026-08-05T16:50:01.341549Z","title":"Dao and A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.341549Z"},"links":{"cited_paper":"/paper/2405.21060","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:d1f3ed4e7a3e4ab8949067f3651e460803ecf8ceef4616b50ffeba31e00c5515","observation_id":"d0e2b325-d6c1-4e91-a041-913b50e71689","resolution":{"observed_at":"2026-08-05T16:50:01.341549Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.669409Z","title":"Narayanan, M","venue":null,"work_id":"447126c0-b529-456f-b7d9-7489c4d7edd0","year":2021},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.436449Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:cba3d31abeb71c08116906e1ce3291a2d751d73127359bb97d6856dc2f6cd87e","observation_id":"f396a69d-d714-4d04-898f-c59d5fcb2509","resolution":{"observed_at":"2026-08-05T16:50:04.738351Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.413922Z","title":null,"venue":null,"work_id":"186842e0-5508-4065-8c15-91900d77f589","year":2002},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.501357Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:e903b8004149189ca4dcfae0a288c350f3766bfad68bd689535722555523c04a","observation_id":"748d2e50-fc50-4927-9d96-013a759c7afa","resolution":{"observed_at":"2026-08-05T16:50:04.494776Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:04.140128Z","title":"Vaswani, N","venue":null,"work_id":"d8d487b8-103c-4062-998e-126f24928b3b","year":2017},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.589542Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:082fe9b3cb8a8cea94ffaf86ec8227dfb5efc325bd3432daeeb9801bbffe9420","observation_id":"7b0caa37-f713-4e85-a3f8-b0e3e292212c","resolution":{"observed_at":"2026-08-05T16:50:04.254773Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.07887","last_updated":"2024-06-12T05:25:15Z","snapshot_observed_at":"2026-07-06T18:29:21.709395Z","submitted_at":"2024-06-12T05:25:15Z","title":"An Empirical Study of Mamba-based Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.07887","snapshot_observed_at":"2026-08-05T16:50:01.777995Z","title":"Waleffe, W","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.777995Z"},"links":{"cited_paper":"/paper/2406.07887","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:28be816ab1d653dc2ea35ba21e753cc25e328759a364d35dbd4d5de2e434603e","observation_id":"d1252783-09ef-4dfd-94a6-211529a7b715","resolution":{"observed_at":"2026-08-05T16:50:01.777995Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.832380Z","title":null,"venue":null,"work_id":"12ccefae-6ebf-4dd5-b2c0-db5bb867ad73","year":2020},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:01.918539Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:dc6112c2931fae62adaddf89a96dc4b781dba82ef1bdc00855b0b8cd89ad0596","observation_id":"63d096aa-58f2-44e1-81e2-304605b2b61c","resolution":{"observed_at":"2026-08-05T16:50:03.974038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.588379Z","title":"Hatamizadeh and J","venue":null,"work_id":"f8de0478-3095-4f8f-be70-3d6722f320d4","year":2025},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.006795Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:118ad827354a3528a7098131c267af051d482ffe01cd9dd1e041ad42a42f7428","observation_id":"f7c37d5b-b609-4da0-b7de-2366541adc90","resolution":{"observed_at":"2026-08-05T16:50:03.676665Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.362633Z","title":null,"venue":null,"work_id":"37d55a94-6b33-4a87-818a-80519811a5bf","year":2009},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.154751Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:808ad7c5f213da4c130ecdabee975c1e7bd271ab2dde3ec752c874483744a0ff","observation_id":"6fa7658c-9cfd-4caa-b340-cbf79f52229b","resolution":{"observed_at":"2026-08-05T16:50:03.454757Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-05T16:50:02.249490Z","title":"Lieber, B","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.249490Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:11ee5156794544da43dd8fc34f0066027f3f6b7a4a73e13868c653950c8147e2","observation_id":"a9f398f1-a230-4e15-ad70-f18cc196ac96","resolution":{"observed_at":"2026-08-05T16:50:02.249490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:03.122473Z","title":"Behrouz and F","venue":null,"work_id":"4c487cb7-8fe8-4964-8653-e45add253ecb","year":2024},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.384762Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:fbe66abb704d320955bca0a59b0d3b9aef45c93a6adc215085caf1bc92868b88","observation_id":"a402bcce-46aa-4277-9cac-293867b99b18","resolution":{"observed_at":"2026-08-05T16:50:03.235533Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T16:50:02.924757Z","title":"Gupta, J","venue":null,"work_id":"ca15b5f2-02bb-481e-b06d-9eda4ade897c","year":2012},"citing_paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T16:50:02.473697Z"},"links":{"citing_paper":"/paper/2508.17679"},"observation_digest":"sha256:687fadcc5989bbc2dda1db12bc46aca91f9dd46df11490bf06f864f596ba7f7e","observation_id":"849ad6bd-4d50-4341-b4f1-97b40586a624","resolution":{"observed_at":"2026-08-05T16:50:03.005167Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.17679","last_updated":"2025-08-25T05:22:27Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-13T23:57:38.042487Z","submitted_at":"2025-08-25T05:22:27Z","title":"Characterizing the Behavior of Training Mamba-based State Space Models on GPUs"},"reference_resolution":{"displayed":17,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":12,"verified_exact":0,"verified_fuzzy":5},"total_outbound_references":17},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 14 August 2026, this Paper Citation Record lists 17 of 17 outbound references and 1 inbound Pith citation observation for arXiv:2508.17679."}