{"as_of":"2026-08-11T04:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:06455f00148632c0f9b55aaa0a8c89597fada04c87e59c3bdcf777652b1b2770","coverage":[{"denominator":65,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":65,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:01:46.443737Z","state":"measured"},{"denominator":66,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":66,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-29T10:07:06.141581Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-29T10:13:17.805330Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"cited_work":{"arxiv_id":"2501.11779","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.11779","snapshot_observed_at":"2026-06-29T10:13:17.805330Z","title":"Glinthawk: A two-tiered architecture for offline llm inference.arXiv preprint arXiv:2501.11779, 2025","venue":null,"work_id":"50d23eef-2c6c-47b9-a9c1-9beeae27b26c","year":2025},"citing_paper":{"arxiv_id":"2605.28095","last_updated":"2026-05-27T07:52:03Z","snapshot_observed_at":"2026-08-05T11:09:49.545612Z","submitted_at":"2026-05-27T07:52:03Z","title":"SiDP: Memory-Efficient Data Parallelism for Offline LLM Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-29T10:07:06.141581Z"},"links":{"cited_paper":"/paper/2501.11779","citing_paper":"/paper/2605.28095"},"observation_digest":"sha256:73c0375f23e78b66b80dab165662b5ce6c8201bc11262ba44c4077da26db4f93","observation_id":"92ab72be-fe40-44fe-beda-082c7f07b3c8","resolution":{"observed_at":"2026-06-29T10:13:17.806801Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.11779/citation-record","integrity":"/paper/2501.11779/integrity","json":"/paper/2501.11779/citation-record.json","paper":"/paper/2501.11779"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.808048Z","title":null,"venue":null,"work_id":"83e58abb-7413-4385-a0f4-1627a3a28059","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.140974Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:cca9fc78b10d42f7dfee29122ab5a709e07ae6c59a4385b4418cad8979bce54e","observation_id":"cd8de5fb-360c-4b60-9eb0-a7750f47ec22","resolution":{"observed_at":"2026-08-10T18:01:47.812432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.792898Z","title":null,"venue":null,"work_id":"a2f9fa11-536a-4a3b-8dfa-621dd9c3a71f","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.146738Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:e6a9ed57c4edb481f9d15c3963d28755f2c4e6f00872a1aac71575c5d276ec33","observation_id":"9afcc265-6c9e-493f-b264-bc249066982e","resolution":{"observed_at":"2026-08-10T18:01:47.797233Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.777739Z","title":null,"venue":null,"work_id":"d971601e-2268-4433-ad08-f7da7f42f1b7","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.152117Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:967bca503a83912cdf34c67c404616252f064e7a2fce34c2cb1a88285f63597d","observation_id":"b17145cb-ea74-4204-b576-b5c5fa1b91f1","resolution":{"observed_at":"2026-08-10T18:01:47.782633Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.760264Z","title":null,"venue":null,"work_id":"eb8d2fc7-e29e-4a7c-85f7-bfe276cc60e3","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.156915Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c15c1b6a3b39d56cd355f02f7c71cd87c19308d9947f2b3eb317c8290e496283","observation_id":"40834a54-9776-447b-9d81-0578cc68fa6c","resolution":{"observed_at":"2026-08-10T18:01:47.764911Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.744541Z","title":null,"venue":null,"work_id":"652cc4da-c156-4a5a-aca4-06500b087bb4","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.161851Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c3f422cb4ca9978ffb456dac5b9579d8b273aef901a631c21fa71afb71f7de67","observation_id":"5476b1d9-7ca1-40a4-a9fc-ce9d313715b6","resolution":{"observed_at":"2026-08-10T18:01:47.749908Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.727379Z","title":null,"venue":null,"work_id":"51916b23-b4b3-4250-a5bf-098d9ab2782f","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.166848Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:67e0aa14af6bc754efdb5d6d532fb59b2227fdce4a007f3d583cf58096b8461c","observation_id":"32ae0556-c6f6-4648-9fc9-bef2c07adc3f","resolution":{"observed_at":"2026-08-10T18:01:47.732416Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.710396Z","title":null,"venue":null,"work_id":"c1fca359-12a3-4c2b-a5d3-8e347cc69ac9","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.172598Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:653e1625e99bda8715483227f1e312730f53a9a2eecf9cda5b6e245dd41b8c46","observation_id":"185deb44-aa19-4381-b0c9-6c2c9ad6812b","resolution":{"observed_at":"2026-08-10T18:01:47.715213Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.693350Z","title":null,"venue":null,"work_id":"1b7dd9c7-2df8-4693-b7b4-dda05b552f36","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.177212Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:e224e7e7a6de913d860c9b203c9a4aee211e9117bfc1cd8ffa7cdf313391735d","observation_id":"d6f5c94e-829c-40e4-b784-ebd37a967a15","resolution":{"observed_at":"2026-08-10T18:01:47.698905Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.675742Z","title":null,"venue":null,"work_id":"a32b9382-37a8-462d-86b3-dfcedc0a6e4d","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.181969Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c00ea84adecb03e4fea3a884af3946301090c58e35b67689164e33dbcf59a4fd","observation_id":"5a96ce76-ce01-404f-91b7-de152b17b688","resolution":{"observed_at":"2026-08-10T18:01:47.680983Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.186890Z","title":"IEEE Standard for Floating-Point Arithmetic","venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.186890Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:da27be008186276a48695f3170f90801473197be24a907a52f8f00b87704b4ee","observation_id":"49fd9485-fe74-4915-ab5c-509fc4535d98","resolution":{"observed_at":"2026-08-10T18:01:46.186890Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-06T15:43:00.292272Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-10T18:01:46.191693Z","title":"Gulavani, and Ramachandran Ramjee","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.191693Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c0cd8e91b78556510b21c5439fa17955d8dd8d32e223cc2db55f3c0e51662cf8","observation_id":"30508ef3-964c-4a89-b862-55a835c64b15","resolution":{"observed_at":"2026-08-10T18:01:46.191693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13245","last_updated":"2023-12-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-22T17:16:38Z","title":"GQA: Training Generalized Multi-Query Transformer Models from Multi-Head Checkpoints","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13245","snapshot_observed_at":"2026-08-10T18:01:46.196980Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.196980Z"},"links":{"cited_paper":"/paper/2305.13245","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a15d8e38f730026227a2a1b9c17b92ec955ee82e627dde9d136f56b5a607c306","observation_id":"0b852a1a-d85d-48e5-ac61-781431ef0e37","resolution":{"observed_at":"2026-08-10T18:01:46.196980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.00032","last_updated":"2022-06-30T18:01:08Z","snapshot_observed_at":"2026-08-07T13:09:22.711587Z","submitted_at":"2022-06-30T18:01:08Z","title":"DeepSpeed Inference: Enabling Efficient Inference of Transformer Models at Unprecedented Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.00032","snapshot_observed_at":"2026-08-10T18:01:46.202032Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.202032Z"},"links":{"cited_paper":"/paper/2207.00032","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:8c1346c2f8d35ce24c9c03cae62844edfe947e7a54c5023f4bd95494cbcf5054","observation_id":"d873e317-48e0-4e95-9548-57e999c07e5a","resolution":{"observed_at":"2026-08-10T18:01:46.202032Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.659002Z","title":null,"venue":null,"work_id":"44a1f953-48c6-41a6-b4a7-c2819a17ac0a","year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.206986Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:882ab6ab84817751919abaf3445cffcdfbb0c2cb84e3c23d4c9f6fa1092cc017","observation_id":"4b10e56c-ab3a-48e8-8081-68882a03d8eb","resolution":{"observed_at":"2026-08-10T18:01:47.664194Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-10T18:01:46.216356Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.216356Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d2dfb4a97883ba2b22325109c77ba3dee8307d8e42f8c79d277aa63d3afd9514","observation_id":"821c8ffe-0d58-480e-ad1a-3e3f0e051c72","resolution":{"observed_at":"2026-08-10T18:01:46.216356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.221091Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.221091Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:b583ff6045ff1672422764831031bdd86baf34ba9c7589b0ba7d46ade109d904","observation_id":"6b0f0fc0-f990-4b19-974a-1ff4ed8a7f96","resolution":{"observed_at":"2026-08-10T18:01:46.221091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01814","last_updated":"2025-04-10T14:56:01Z","snapshot_observed_at":"2026-07-06T18:09:08.963593Z","submitted_at":"2024-05-03T02:15:15Z","title":"Efficient Heterogeneous Large Language Model Decoding with Model-Attention Disaggregation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01814","snapshot_observed_at":"2026-08-10T18:01:46.225490Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.225490Z"},"links":{"cited_paper":"/paper/2405.01814","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:3ee312a52d08235c9a7f8d730527cc53af361949b7ea30c8c58614ea40428417","observation_id":"dfc4d592-14b0-4872-b016-572b6b7205cb","resolution":{"observed_at":"2026-08-10T18:01:46.225490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.642463Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":"ec133071-1fa5-498a-899f-1068448ccc76","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.230083Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:76c5c2f499704c9a3c29474a833d0cf9e7e2027845cbfb4064a67842c63632c1","observation_id":"98e3309a-8922-4408-8530-5963028a63ff","resolution":{"observed_at":"2026-08-10T18:01:47.647618Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.08691","last_updated":"2023-07-17T17:50:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-17T17:50:36Z","title":"FlashAttention-2: Faster Attention with Better Parallelism and Work Partitioning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.08691","snapshot_observed_at":"2026-08-10T18:01:46.234652Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.234652Z"},"links":{"cited_paper":"/paper/2307.08691","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:257f47986280dfae5978ab6d023c52c3ec9d34ce1c57d9fef66d741a82af4c72","observation_id":"f7acc176-41e2-4c67-900c-1bfb10329ef2","resolution":{"observed_at":"2026-08-10T18:01:46.234652Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.239316Z","title":"Fu, Stefano Ermon, Atri Rudra, and Christopher Ré","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.239316Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:a9a74fc46597cebd73474d39bc6b33fee73009f4c2929fb724d24f9f85bb2cd2","observation_id":"a0020f9a-f8d6-4595-8b60-7ddc5010b49c","resolution":{"observed_at":"2026-08-10T18:01:46.239316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:01:46.247690Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.247690Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2784ba896b8c34e667887f218e71d926ef7ee1747b25d50d9aa7efd02213c9d4","observation_id":"fa93b2c9-582e-40a1-a862-d63a7b72ce3c","resolution":{"observed_at":"2026-08-10T18:01:46.247690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14135","last_updated":"2022-06-23T17:53:32Z","snapshot_observed_at":"2026-07-06T13:14:48.753329Z","submitted_at":"2022-05-27T17:53:09Z","title":"FlashAttention: Fast and Memory-Efficient Exact Attention with IO-Awareness","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14135","snapshot_observed_at":"2026-08-10T18:01:46.243579Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.243579Z"},"links":{"cited_paper":"/paper/2205.14135","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:cd471407274745d041695149dbcaaaeae86787c959f3e581b4531b72f3a8d84b","observation_id":"6de14574-7611-41a9-bc56-159929147cf3","resolution":{"observed_at":"2026-08-10T18:01:46.243579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.617173Z","title":null,"venue":null,"work_id":"61fd58c3-7406-4672-8a01-5a7b7af96500","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.256388Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:90ea52f75d57509757e8ac9672b901bcc7d9e95a3a8797b9822e2eef4cb78c8d","observation_id":"df405801-7510-4393-ba9d-c170c58d0343","resolution":{"observed_at":"2026-08-10T18:01:47.621766Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01667","last_updated":"2022-09-04T18:00:29Z","snapshot_observed_at":"2026-08-10T21:30:58.269678Z","submitted_at":"2022-09-04T18:00:29Z","title":"A Review of Sparse Expert Models in Deep Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01667","snapshot_observed_at":"2026-08-10T18:01:46.251978Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.251978Z"},"links":{"cited_paper":"/paper/2209.01667","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:88889d28e96a983fb76511bf03feaa08c2e16b94ed533d6165ce1c04b8d1cada","observation_id":"230a61d0-3247-457e-8bf9-041081624c0e","resolution":{"observed_at":"2026-08-10T18:01:46.251978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.602286Z","title":null,"venue":null,"work_id":"c22c2089-dff2-49a9-bfb0-4d921462d075","year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.264975Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7b10c5ab0127084a60ca4bca3810da4a18e75ad3c2340a95c7acee832fc63f06","observation_id":"e5db946e-4b6a-4c3e-a57b-2ba309b685e3","resolution":{"observed_at":"2026-08-10T18:01:47.606695Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.260751Z","title":null,"venue":null,"work_id":null,"year":1994},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.260751Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:813bf4e44d3cd411cbf26fb34bde5a6d7b9105741a666dc6fd72347ad6727f0d","observation_id":"b71d3ac2-652b-4b38-bf8e-b82d796d912d","resolution":{"observed_at":"2026-08-10T18:01:46.260751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.05099","last_updated":"2024-05-13T08:49:44Z","snapshot_observed_at":"2026-08-09T16:33:20.413953Z","submitted_at":"2024-02-07T18:53:01Z","title":"Hydragen: High-Throughput LLM Inference with Shared Prefixes","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.05099","snapshot_observed_at":"2026-08-10T18:01:46.274340Z","title":"Fu, Christo- pher Ré, and Azalia Mirhoseini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.274340Z"},"links":{"cited_paper":"/paper/2402.05099","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:410df7e746581b2c0a3e5be382e3b8c51393759b39a29f0c9d3b0a1deb681619","observation_id":"7be11884-41b4-47eb-aaa8-98915c69c71e","resolution":{"observed_at":"2026-08-10T18:01:46.274340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.04088","last_updated":"2024-01-08T18:47:34Z","snapshot_observed_at":"2026-08-08T06:16:25.839566Z","submitted_at":"2024-01-08T18:47:34Z","title":"Mixtral of Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.04088","snapshot_observed_at":"2026-08-10T18:01:46.269431Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.269431Z"},"links":{"cited_paper":"/paper/2401.04088","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:6c941739a1eafe41d7d44726f3ea2ed17c345b358dba5e964b05418010ce0c48","observation_id":"d4b7bc4e-ddf8-4658-af62-ab28c98b8f48","resolution":{"observed_at":"2026-08-10T18:01:46.269431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11665","last_updated":"2023-07-19T04:03:11Z","snapshot_observed_at":"2026-08-05T15:40:10.466298Z","submitted_at":"2023-02-22T21:41:34Z","title":"AlpaServe: Statistical Multiplexing with Model Parallelism for Deep Learning Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.11665","snapshot_observed_at":"2026-08-10T18:01:46.288769Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.288769Z"},"links":{"cited_paper":"/paper/2302.11665","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:570400d20d38357dadb0e8b097ef578e7be548628e54f29365b1b0c0d5923933","observation_id":"f8976462-c76a-4b5f-abbb-98e1e5806d2d","resolution":{"observed_at":"2026-08-10T18:01:46.288769Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.279142Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.279142Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0456f1cc4e83b180d78135ea9126b2bb4c0d28cf745a0c5a4bdd43670863500c","observation_id":"bd323758-0973-4522-b625-69ca3526214e","resolution":{"observed_at":"2026-08-10T18:01:46.279142Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.00978","last_updated":"2026-04-25T06:58:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T17:59:10Z","title":"AWQ: Activation-aware Weight Quantization for LLM Compression and Acceleration","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.00978","snapshot_observed_at":"2026-08-10T18:01:46.298972Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.298972Z"},"links":{"cited_paper":"/paper/2306.00978","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:8562d8632aa0f9a3903954a658dd723b7cc90617ae9c15257092ff4200756f2d","observation_id":"0114ff0f-e917-4c51-826f-57473f90e5c3","resolution":{"observed_at":"2026-08-10T18:01:46.298972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01889","last_updated":"2023-11-27T06:38:47Z","snapshot_observed_at":"2026-08-07T09:22:20.831075Z","submitted_at":"2023-10-03T08:44:50Z","title":"Ring Attention with Blockwise Transformers for Near-Infinite Context","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01889","snapshot_observed_at":"2026-08-10T18:01:46.304481Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.304481Z"},"links":{"cited_paper":"/paper/2310.01889","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7fbdba91fb4e4a4ceab0b222d09dd2719cc0df0a97fbf1ffee0049b1f080c283","observation_id":"8e6f5535-8ba1-432d-8af5-80c971140973","resolution":{"observed_at":"2026-08-10T18:01:46.304481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02669","last_updated":"2024-07-04T15:12:54Z","snapshot_observed_at":"2026-08-11T00:55:35.992515Z","submitted_at":"2024-01-05T06:53:00Z","title":"Infinite-LLM: Efficient LLM Service for Long Context with DistAttention and Distributed KVCache","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02669","snapshot_observed_at":"2026-08-10T18:01:46.293818Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.293818Z"},"links":{"cited_paper":"/paper/2401.02669","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:8d4b0b0ac7a62e2ae13e3e916405ff26a2eac8e7e021d20b6916e3bcb3e4c84d","observation_id":"fa98683e-5b9a-43f0-a904-6183b0d6c34c","resolution":{"observed_at":"2026-08-10T18:01:46.293818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.313249Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.313249Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d50015314b48821b294bc7f9f9c5ddec4b43e74eb87d5a0a3f8f51e3849c23a8","observation_id":"ee5166c2-c1a0-4b1c-adc1-74aa3e589515","resolution":{"observed_at":"2026-08-10T18:01:46.313249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.09911","last_updated":"2022-12-24T10:12:53Z","snapshot_observed_at":"2026-08-10T20:46:48.127668Z","submitted_at":"2022-05-20T00:53:43Z","title":"Can Foundation Models Wrangle Your Data?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.09911","snapshot_observed_at":"2026-08-10T18:01:46.317445Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.317445Z"},"links":{"cited_paper":"/paper/2205.09911","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:62d3e23fe8fcb0ec529f24faf569f3ec66ac23c57f4954ba3489998130c38994","observation_id":"9b20b16e-4b1b-4b6b-84d2-eeba8a108ed3","resolution":{"observed_at":"2026-08-10T18:01:46.317445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2008.07772","last_updated":"2020-10-14T22:56:32Z","snapshot_observed_at":"2026-08-06T01:07:00.222113Z","submitted_at":"2020-08-18T07:14:54Z","title":"Very Deep Transformers for Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2008.07772","snapshot_observed_at":"2026-08-10T18:01:46.309018Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.309018Z"},"links":{"cited_paper":"/paper/2008.07772","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:55b89e0fa5bd35612bd5b612e2bfed1e5e1e974751c4dbc6a27b253078b89e46","observation_id":"6328fcdd-c8a6-4999-ae95-e56846b34da7","resolution":{"observed_at":"2026-08-10T18:01:46.309018Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.325426Z","title":null,"venue":null,"work_id":null,"year":2008},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.325426Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7a3d13b6c4c7c07094871be0de2669fc2702ccdc2f80cdb1fd0492491109eabe","observation_id":"6fe44fe3-76cd-49eb-aa0b-1d355d017a14","resolution":{"observed_at":"2026-08-10T18:01:46.325426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.562173Z","title":null,"venue":null,"work_id":"b8c47d7a-7d15-4721-9d21-8d2da735af64","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.329244Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0ee660397021e37bb3de82370e02a5050617ee8bb9c77a62af461baf49019667","observation_id":"c77e6827-4ea1-4d3f-a9bc-6b04e3dcacaf","resolution":{"observed_at":"2026-08-10T18:01:47.566549Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.576546Z","title":null,"venue":null,"work_id":"9e21bb51-dbbc-409f-bf1f-7c5e378597d3","year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.321446Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:6779bcfd875280fcce7917934717d997b8aa763bec6cec8d1ece55afeaf09b9e","observation_id":"a12cfd8b-e8f4-4433-b6db-008b8cc6c386","resolution":{"observed_at":"2026-08-10T18:01:47.581844Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.546331Z","title":null,"venue":null,"work_id":"e1201fd0-9936-4cb5-8012-123017161947","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.338347Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2f424b76dd68e004e036482e9d0192e533b1bf65eb321118a0ee158e949f39a0","observation_id":"d608c8dd-c737-4c05-acef-536a9115555d","resolution":{"observed_at":"2026-08-10T18:01:47.551053Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.342837Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.342837Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:cbd334c18b921526529d6124f639498fab1f623fc546a14d5e6336ed699aa52d","observation_id":"ed95a91c-db04-4f62-89b6-c23584fb5e00","resolution":{"observed_at":"2026-08-10T18:01:46.342837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.18677","last_updated":"2024-05-20T15:37:36Z","snapshot_observed_at":"2026-08-10T21:29:53.476151Z","submitted_at":"2023-11-30T16:24:42Z","title":"Splitwise: Efficient generative LLM inference using phase splitting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.18677","snapshot_observed_at":"2026-08-10T18:01:46.333688Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.333688Z"},"links":{"cited_paper":"/paper/2311.18677","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:76ea960eb5ffc58ebe2a0d4de7881ff3c9acba14dcea55fe0aac87d0de23e33c","observation_id":"008b4344-7dd3-45f0-807d-d483848decd0","resolution":{"observed_at":"2026-08-10T18:01:46.333688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:46.352066Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.352066Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ef41e0eedd08716fa7a3f4fab205c20adfea95daf6d65762e545f758dfb46cb8","observation_id":"09dea148-68ba-4b46-ab31-f4962826ad67","resolution":{"observed_at":"2026-08-10T18:01:46.352066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.506864Z","title":null,"venue":null,"work_id":"5473582a-0251-430e-9f82-7bf9410e10d8","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.362128Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:6e7f6bc8f150866011b55fbc3bd1b1be0125238d1c2ea2d057c9ef717bf36740","observation_id":"4a4d17f1-51ec-4698-af02-cf6ce691bef2","resolution":{"observed_at":"2026-08-10T18:01:47.511723Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02054","last_updated":"2020-05-13T06:45:15Z","snapshot_observed_at":"2026-07-06T08:27:00.558613Z","submitted_at":"2019-10-04T17:29:39Z","title":"ZeRO: Memory Optimizations Toward Training Trillion Parameter Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.02054","snapshot_observed_at":"2026-08-10T18:01:46.347288Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.347288Z"},"links":{"cited_paper":"/paper/1910.02054","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:7cbad80da0003228ab3d91a8883ad24a77a6264eb2188be51d44cd4ac07b38d4","observation_id":"8a63bae5-8be2-49fb-8f40-8dc294552bbb","resolution":{"observed_at":"2026-08-10T18:01:46.347288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1701.06538","last_updated":"2017-01-23T18:10:00Z","snapshot_observed_at":"2026-07-06T05:27:13.416519Z","submitted_at":"2017-01-23T18:10:00Z","title":"Outrageously Large Neural Networks: The Sparsely-Gated Mixture-of-Experts Layer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1701.06538","snapshot_observed_at":"2026-08-10T18:01:46.371711Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.371711Z"},"links":{"cited_paper":"/paper/1701.06538","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:5646e61e8aa45e1fe320674624ea9a6aa3e28e67d509a388ca02336ca2831d7d","observation_id":"e3109990-33ca-4a29-8056-87fc6b526f6d","resolution":{"observed_at":"2026-08-10T18:01:46.371711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.06865","last_updated":"2023-06-12T07:48:53Z","snapshot_observed_at":"2026-08-06T08:43:40.051791Z","submitted_at":"2023-03-13T05:19:28Z","title":"FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.06865","snapshot_observed_at":"2026-08-10T18:01:46.376642Z","title":"Fu, Zhiqiang Xie, Beidi Chen, Clark Barrett, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.376642Z"},"links":{"cited_paper":"/paper/2303.06865","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ce913493717cf56f83c42f78890597394470d24f45e9e977c31720021350c20b","observation_id":"538f9376-388b-4a88-bd12-368ad2660701","resolution":{"observed_at":"2026-08-10T18:01:46.376642Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-10T18:01:46.381691Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.381691Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2154a7198d87666bde15785597705141765184fa0a49831cd92f3e7792905cf7","observation_id":"ddef0a13-13fc-4950-85de-3fddc4607b09","resolution":{"observed_at":"2026-08-10T18:01:46.381691Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.02150","last_updated":"2019-11-06T00:19:05Z","snapshot_observed_at":"2026-07-06T08:35:01.386074Z","submitted_at":"2019-11-06T00:19:05Z","title":"Fast Transformer Decoding: One Write-Head is All You Need","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.02150","snapshot_observed_at":"2026-08-10T18:01:46.366806Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.366806Z"},"links":{"cited_paper":"/paper/1911.02150","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:0237860f751fcd91c2ad639d284f223c26511f0ef579741132e70ab6b3e644c9","observation_id":"afc9cdde-5e85-4042-8003-9455e23d8fd1","resolution":{"observed_at":"2026-08-10T18:01:46.366806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08295","last_updated":"2024-04-16T12:52:47Z","snapshot_observed_at":"2026-08-03T03:29:01.959523Z","submitted_at":"2024-03-13T06:59:16Z","title":"Gemma: Open Models Based on Gemini Research and Technology","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08295","snapshot_observed_at":"2026-08-10T18:01:46.395770Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.395770Z"},"links":{"cited_paper":"/paper/2403.08295","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9bf1ec262b7ebb42b2374df5ea19fa9dd6f7a620a0551d523858e8b7f51863f1","observation_id":"1388f066-5ab7-4032-800b-0946cd7feb8e","resolution":{"observed_at":"2026-08-10T18:01:46.395770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T18:01:46.400525Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.400525Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:b037dd1832c94f0ea5d3430455d2b42b572da4d2ba82e6976035f5ec05614fc7","observation_id":"e6e96f27-0529-4ed8-9291-2434bfab177a","resolution":{"observed_at":"2026-08-10T18:01:46.400525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-10T18:01:46.405679Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.405679Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:1bb3a2632772d9b6870afd2864caf79ee39164886a7569135075e54ff4e4a709","observation_id":"c8075934-419a-4ff1-824a-69fc162d6966","resolution":{"observed_at":"2026-08-10T18:01:46.405679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.491107Z","title":"Hashimoto","venue":null,"work_id":"be2bc9a6-0322-415c-b10f-8ecb08e51896","year":null},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.386417Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:6025049df5f276940f7ed41eb9fb1115a2c9be855d543b558dd3228c0dc2ad07","observation_id":"7b1b74c8-5585-4af5-9e9d-9f80e3477958","resolution":{"observed_at":"2026-08-10T18:01:47.495870Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.474071Z","title":"https://github.com/tatsu-lab/stanford_alpaca","venue":null,"work_id":"381bdb6f-5415-4c99-bd5f-9e36f9f2bd16","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.391253Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:95067808c53aea3394f500e6237e3f48be6b8c2fe182a6a4fd5095886f7c00eb","observation_id":"aa9fc5da-241b-48a4-a391-f12f25d25746","resolution":{"observed_at":"2026-08-10T18:01:47.480502Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17453","last_updated":"2024-04-07T00:56:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-29T17:59:56Z","title":"Efficient Streaming Language Models with Attention Sinks","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17453","snapshot_observed_at":"2026-08-10T18:01:46.419673Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.419673Z"},"links":{"cited_paper":"/paper/2309.17453","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:f262b0068401430593e063d7412ab9e0cd36628204722bb2f80497d11cace0ce","observation_id":"6638c6f8-f207-4fbc-9d19-e9a5194ea8a8","resolution":{"observed_at":"2026-08-10T18:01:46.419673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.440007Z","title":null,"venue":null,"work_id":"5677f0ba-287e-4819-b57a-b522b2e07eeb","year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.424728Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:f9196b578c24f3c29635c8c562a3e803b61f2c444cdf5844d00ec9138d06ce3f","observation_id":"1a341c62-7758-4ef6-9b7b-f3a906243954","resolution":{"observed_at":"2026-08-10T18:01:47.446422Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2304.11277","last_updated":"2023-09-12T16:28:00Z","snapshot_observed_at":"2026-08-01T19:01:47.393546Z","submitted_at":"2023-04-21T23:52:27Z","title":"PyTorch FSDP: Experiences on Scaling Fully Sharded Data Parallel","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.11277","snapshot_observed_at":"2026-08-10T18:01:46.429279Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.429279Z"},"links":{"cited_paper":"/paper/2304.11277","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9f9dbc3b59545291fa4248bc2c2ebb0bd8bfdfa2e754d8366e9797f87fb3210a","observation_id":"ead83c85-b29d-4a54-8b74-e380f9d34488","resolution":{"observed_at":"2026-08-10T18:01:46.429279Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1706.03762","last_updated":"2023-08-02T00:41:18Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2017-06-12T17:57:34Z","title":"Attention Is All You Need","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1706.03762","snapshot_observed_at":"2026-08-10T18:01:46.410490Z","title":"Gomez, Lukasz Kaiser, and Illia Polosukhin","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.410490Z"},"links":{"cited_paper":"/paper/1706.03762","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:c3d960c9dd06b4e115709f67e3a9f7ed287588152e1731cc77ddeb7f7860cff8","observation_id":"94e4e9b8-bffb-405d-a62d-5efe4dd4944f","resolution":{"observed_at":"2026-08-10T18:01:46.410490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:01:47.457980Z","title":null,"venue":null,"work_id":"5c02bffb-fe62-4370-b1dd-0bf1eaae5d45","year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.414954Z"},"links":{"citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:9b0321a9fe5492314094140fa95ea8a76f1cd9216e3fd0837539abf390d29829","observation_id":"6aac2e18-c272-4954-a29b-1199c8c3ddca","resolution":{"observed_at":"2026-08-10T18:01:47.463238Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07104","last_updated":"2024-06-06T00:10:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-12T09:34:27Z","title":"SGLang: Efficient Execution of Structured Language Model Programs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07104","snapshot_observed_at":"2026-08-10T18:01:46.443737Z","title":"Gonzalez, Clark Barrett, and Ying Sheng","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.443737Z"},"links":{"cited_paper":"/paper/2312.07104","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:70d04b8a5775907427d11f80041d71e38cd173abd18da8c3c38bb73fbb947c92","observation_id":"e6ae9f20-fcf8-4cfd-9b14-1d03b3498b32","resolution":{"observed_at":"2026-08-10T18:01:46.443737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-10T18:01:46.434131Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.434131Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:d674964b3825e889300f04f1fd189438ba7ac8dc208fc6e3f3eaaf940f90491e","observation_id":"78efc752-fb3c-448b-8aa0-b3c6f03409f4","resolution":{"observed_at":"2026-08-10T18:01:46.434131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.12023","last_updated":"2022-06-28T19:36:44Z","snapshot_observed_at":"2026-08-07T05:15:09.810779Z","submitted_at":"2022-01-28T10:13:35Z","title":"Alpa: Automating Inter- and Intra-Operator Parallelism for Distributed Deep Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.12023","snapshot_observed_at":"2026-08-10T18:01:46.438859Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.438859Z"},"links":{"cited_paper":"/paper/2201.12023","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:ed94fc57b60c8567779097ed5a9b58c08e41a382787650284eba4a6013b4f245","observation_id":"246c3827-a89b-4aa2-9451-d0bfe498b018","resolution":{"observed_at":"2026-08-10T18:01:46.438859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.06840","last_updated":"2021-01-18T02:11:25Z","snapshot_observed_at":"2026-07-06T10:33:17.427927Z","submitted_at":"2021-01-18T02:11:25Z","title":"ZeRO-Offload: Democratizing Billion-Scale Model Training","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.06840","snapshot_observed_at":"2026-08-10T18:01:46.357295Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.357295Z"},"links":{"cited_paper":"/paper/2101.06840","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:88c22d31cedbdd144a7d923255a9b523f44f9fba7b1358f5258594b4bdef9189","observation_id":"f8781437-3a20-4210-8d3c-598c1a342079","resolution":{"observed_at":"2026-08-10T18:01:46.357295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.01188","last_updated":"2023-03-02T19:33:31Z","snapshot_observed_at":"2026-08-09T03:33:05.296150Z","submitted_at":"2022-09-02T17:38:03Z","title":"Petals: Collaborative Inference and Fine-tuning of Large Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.01188","snapshot_observed_at":"2026-08-10T18:01:46.211564Z","title":"arXiv preprint arXiv:2209.01188 (2022)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.211564Z"},"links":{"cited_paper":"/paper/2209.01188","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:17e6e8d69da257d8bab5bc671845641a9ead7f67e0293f4d72d22f41b7b53446","observation_id":"641f29ab-e41c-47fd-9499-c9961485dcc7","resolution":{"observed_at":"2026-08-10T18:01:46.211564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.06180","snapshot_observed_at":"2026-08-10T18:01:46.284071Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-10T18:01:46.284071Z"},"links":{"cited_paper":"/paper/2309.06180","citing_paper":"/paper/2501.11779"},"observation_digest":"sha256:2f11b1c14b4765aa75940b8ac5b33fe802c28a65fc5278ad82f07be8a99424e6","observation_id":"a5ea8d80-6826-4545-b75a-8d3a2f494986","resolution":{"observed_at":"2026-08-10T18:01:46.284071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.11779","last_updated":"2025-02-11T17:36:32Z","latest_version":2,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-10T20:47:26.584610Z","submitted_at":"2025-01-20T23:10:13Z","title":"Glinthawk: A Two-Tiered Architecture for Offline LLM Inference"},"reference_resolution":{"displayed":65,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":65},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 65 of 65 outbound references and 1 inbound Pith citation observation for arXiv:2501.11779."}