{"as_of":"2026-08-16T07:34:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3aa26202f24f82c6fb40dceae7cc5ba533a667e90d684790386a292324d84f7d","coverage":[{"denominator":40,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":40,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T22:59:41.651892Z","state":"measured"},{"denominator":40,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":40,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2501.01990/citation-record","integrity":"/paper/2501.01990/integrity","json":"/paper/2501.01990/citation-record.json","paper":"/paper/2501.01990"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.612504Z","title":"AWS Trainium","venue":null,"work_id":"ae422885-3f39-4c97-9d8f-bb048d476dcc","year":null},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.429822Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:29b4592e66a29a898e03644ce5f8278684d33cffc593b9e79ab0bdde89481b76","observation_id":"bf68ce9e-ca05-4a27-a76d-5e784ee23243","resolution":{"observed_at":"2026-08-10T22:59:42.618385Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.596691Z","title":"Reducing the carbon impact of generative AI inference (today and in 2035)","venue":null,"work_id":"541cf946-0d80-4387-96d3-1d65a28f9228","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.435938Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:82879b7b356cc9063f9bf95f313aef5806cc21c47c5c4c09a67a836164248243","observation_id":"13a151b6-dd24-4d8f-ae37-d3a3c715e157","resolution":{"observed_at":"2026-08-10T22:59:42.601568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.02311","snapshot_observed_at":"2026-08-10T22:59:41.442520Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.442520Z"},"links":{"cited_paper":"/paper/2204.02311","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:1c5371648ee4ae7ab9684d8d626e713e3355105b6103b13830a6058cf2ae8ba3","observation_id":"a3c9fd5d-e1c6-479a-aba0-72b07a5cf7ed","resolution":{"observed_at":"2026-08-10T22:59:41.442520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.581172Z","title":"Electricity maps","venue":null,"work_id":"6f75f110-a6e3-4257-9d95-4d25a256bee0","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.448735Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:17bbfee542aa769fcaa80e04fbd2cf2d49c925f11ccfe5e5a886d5fa3450ae17","observation_id":"2c591211-a6c6-4fb4-81ac-d4d3a4b5837f","resolution":{"observed_at":"2026-08-10T22:59:42.586450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.564955Z","title":"Fine- tuning giant neural networks on commodity hardware with automatic pipeline model parallelism","venue":null,"work_id":"8958a731-44b3-4df8-9512-d901e5b8147e","year":2021},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.454609Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:db08df047b73d1d48bf866779f9de6e94d4bb30f8fbea43e40f93365fe125f9f","observation_id":"329323fe-7efe-4c62-952c-0dd3d4a92101","resolution":{"observed_at":"2026-08-10T22:59:42.570198Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.547858Z","title":"LLMCarbon: Modeling the end-to-end carbon footprint of large language models","venue":null,"work_id":"eba2db58-0e11-4bc2-b892-10cfc2b727e7","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.460255Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:2b6fe474465495ed3eafc8fc3c3514391c712362e61fbeccc271752df24f6bbf","observation_id":"b6ea0d18-0423-4e23-a6d0-f45b5cfc6b56","resolution":{"observed_at":"2026-08-10T22:59:42.552869Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19708","last_updated":"2024-06-30T23:50:38Z","snapshot_observed_at":"2026-08-13T19:25:34.315069Z","submitted_at":"2024-03-23T10:42:49Z","title":"Cost-Efficient Large Language Model Serving for Multi-turn Conversations with CachedAttention","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19708","snapshot_observed_at":"2026-08-10T22:59:41.466114Z","title":"AttentionStore: Cost-effective attention reuse across multi-turn conversations in large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.466114Z"},"links":{"cited_paper":"/paper/2403.19708","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:a57c0d88894686c8490f67530e2e6e23869cba3a19664be718031333bd27808e","observation_id":"8cc2e6eb-1f51-40c2-8680-d3e3c2076fd0","resolution":{"observed_at":"2026-08-10T22:59:41.466114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.529996Z","title":"Accelerate AI development with Google cloud TPUs","venue":null,"work_id":"8ff2fd1d-2adf-4129-934a-42d022a04792","year":null},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.472529Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:412600927a5cf767c1f5adf727a93164354addad2e5a10f19bb991cc7a31fbac","observation_id":"4c6a22a2-27f0-4d3d-a75a-c2a82677db15","resolution":{"observed_at":"2026-08-10T22:59:42.536143Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"article/2020030","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:41.999624Z","title":"Why your internet habits are not as clean as you think","venue":null,"work_id":"2ba1cd1b-72d4-4c1e-886a-7f096a8b799c","year":2020},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.477761Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:6ebb65a07e6de1478a6d58b7678c48367e15e82b9648b58ea2f6935f9eed0009","observation_id":"96fee8bd-69e2-4de8-8eea-afdb59706d0a","resolution":{"observed_at":"2026-08-10T22:59:42.008197Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.511900Z","title":"Lee, David Brooks, and Carole-Jean Wu","venue":null,"work_id":"744c87bd-7e75-4bd1-a748-2dfab57637bc","year":2022},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.484547Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:9e8252633e9c62359e564441d87d17875e7d41c64995f54ff9c976ee6bf943cf","observation_id":"b05c6086-3116-4798-8d37-638a1b306e88","resolution":{"observed_at":"2026-08-10T22:59:42.517160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18338","last_updated":"2024-02-27T13:24:06Z","snapshot_observed_at":"2026-08-13T05:44:04.574494Z","submitted_at":"2023-10-21T15:23:20Z","title":"Small Language Models Fine-tuned to Coordinate Larger Language Models improve Complex Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18338","snapshot_observed_at":"2026-08-10T22:59:41.490618Z","title":"Small language models fine-tuned to coordinate larger language models improve complex reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.490618Z"},"links":{"cited_paper":"/paper/2310.18338","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:19b9427f54d9e60b58d4b582305d316be2bf75538ce7030c4fac6d8373926689","observation_id":"77fdce02-bfd6-459d-bce6-8230f3785780","resolution":{"observed_at":"2026-08-10T22:59:41.490618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.494869Z","title":"Fast inference from transform- ers via speculative decoding","venue":null,"work_id":"31ec694f-1601-4765-89f0-a8eeebf60a26","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.497085Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:fa0ca15ab0d98fec914be919a2e6b7a1f1dd67bb7a2f611e09c8f80d801d70cd","observation_id":"0f53dac2-aca2-4afe-b0b8-395965e139e7","resolution":{"observed_at":"2026-08-10T22:59:42.500433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.470717Z","title":"Toward sustainable HPC: Carbon footprint estimation and environmental implications of HPC systems","venue":null,"work_id":"42a2c283-57bf-4cfa-9079-7a8ddefa54d8","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.503036Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:4a7ea549e0f8486898f965d4b51f2c037d3424ab540eaddba5bd7e4f7ca8a090","observation_id":"69e53815-ecc2-4b6a-8650-8ea4c21dae10","resolution":{"observed_at":"2026-08-10T22:59:42.476795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.454004Z","title":"Is your code generated by ChatGPT really correct? rigorous evaluation of large language models for code generation","venue":null,"work_id":"db6aec93-2949-42e9-8cf0-9e8c4135631b","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.508613Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:863fe7ceaa3d5952eb655650e495c547005d1cc30e7f05d479a14d9927378a85","observation_id":"92569acb-41ac-4e53-9c05-0fae7cf8d56d","resolution":{"observed_at":"2026-08-10T22:59:42.459306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.08476","last_updated":"2023-02-16T18:35:00Z","snapshot_observed_at":"2026-08-13T12:43:11.543818Z","submitted_at":"2023-02-16T18:35:00Z","title":"Counting Carbon: A Survey of Factors Influencing the Emissions of Machine Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.08476","snapshot_observed_at":"2026-08-10T22:59:41.514240Z","title":"Counting carbon: A survey of factors influencing the emissions of machine learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.514240Z"},"links":{"cited_paper":"/paper/2302.08476","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:e7b6133c3b21f506b19a579ae51e275284a46c3d3149b9f2c3ead98fea906624","observation_id":"20024992-6927-462c-ac1e-05abb80d4657","resolution":{"observed_at":"2026-08-10T22:59:41.514240Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.437545Z","title":"Estimating the carbon footprint of BLOOM, A 176B parameter language model","venue":null,"work_id":"8125d58c-a6c8-4034-ad29-2299937abf49","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.520109Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:650683112219577343bdf2b95824ef732068c7ac1c6e79b7c0609b74318630e2","observation_id":"d0010800-0cf1-4e04-a5b7-63e112816355","resolution":{"observed_at":"2026-08-10T22:59:42.442749Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.420167Z","title":"Bringing carbon awareness to multi-cloud application delivery","venue":null,"work_id":"70744e77-ea37-4b87-b9de-6f8d17994bf7","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.525636Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:1f6050968dfc4a185a01d925835e4dccd684c0be8b9128ea0a5707e16712337d","observation_id":"76366ff8-20a0-4b66-b317-3c606d82517f","resolution":{"observed_at":"2026-08-10T22:59:42.425374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.292938Z","title":"Sitaraman","venue":null,"work_id":"493a0097-1f0b-4afe-a67c-e7661af51fd4","year":2022},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.531525Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:8c153c91efda4c6a4e6b74792f38510f9ee397ae4f017f341a1eb08996f84309","observation_id":"503f2a08-f7b3-4897-a370-b1fbfa013d60","resolution":{"observed_at":"2026-08-10T22:59:42.407842Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.276466Z","title":"Sitaraman, and Prashant Shenoy","venue":null,"work_id":"888b9bc2-7069-46fa-8553-8940dd23fba9","year":2022},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.537901Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:bd69fadecda823ed60b8d096db1d475b99fb72e480cc969458d6df3f9c390183","observation_id":"d6f3b6d0-3dc0-4fab-9a9b-84bd779a5a5a","resolution":{"observed_at":"2026-08-10T22:59:42.282128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.260545Z","title":"MTIA v1: Meta’s first-generation AI inference accelerator","venue":null,"work_id":"d153bd92-56e6-4e14-b9e7-18b2cefd805e","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.543487Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:8df2283a515eb13ea83e9228a89d222fb1a0aa8376b7b7157beedefc18f83936","observation_id":"abc497d3-ef3d-4821-993d-21f3772bb373","resolution":{"observed_at":"2026-08-10T22:59:42.265653Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.243451Z","title":"NVIDIA HGX AI Supercomputer","venue":null,"work_id":"7dd8245f-4fde-49c4-8b63-4997f5b2f891","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.548196Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:6865b9c83df4c9d14ef2adde32cdcead51e50e77e7a4d607b7ed2363d2e84599","observation_id":"6a3138b1-8208-441f-be0c-2e524f2bbaf1","resolution":{"observed_at":"2026-08-10T22:59:42.248337Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.227577Z","title":"NVIDIA management library (NVML)","venue":null,"work_id":"5556a921-34d6-4a07-b297-2009c3a67aab","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.552771Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:be87662373dfe216345b511a69cd50788ce3feffd749ee25e2491496cb3022e0","observation_id":"9002b9f7-abea-4745-ad59-16353fe32a26","resolution":{"observed_at":"2026-08-10T22:59:42.233086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.211784Z","title":"Ashraf, Christian Engelmann, Mallikarjun Shankar, and James H","venue":null,"work_id":"b416de5d-0f68-475d-af83-7531f1946ac9","year":2020},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.557390Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:8da6db8a9fc89e9818e1766ee677b17afe9cea7aa7259f4bb6cb46c298c76339","observation_id":"54bb7531-422b-48af-ba70-7b522918f5a7","resolution":{"observed_at":"2026-08-10T22:59:42.216849Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.195505Z","title":"Splitwise improves GPU usage by splitting LLM inference phases","venue":null,"work_id":"0183bca2-b261-4760-9885-64c06b35e82e","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.562712Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:0e7cd6f27ef335a21a859c3ff51926236f0d8af0fe156314e58b61ead30509a9","observation_id":"5de76dd5-9c77-48c6-95d1-dc14369130eb","resolution":{"observed_at":"2026-08-10T22:59:42.200609Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.178890Z","title":"So, Maud Texier, and Jeff Dean","venue":null,"work_id":"8ef37731-4c57-4fac-9613-cd6196539e61","year":2022},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.568407Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:1cdaa104a91a233091bb7d31e85357b64ee50a14f7af75c7fbe08d4d4dd25116","observation_id":"a6aa644a-c1f2-4126-ab03-997972818433","resolution":{"observed_at":"2026-08-10T22:59:42.184194Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.162506Z","title":"HuggingGPT: Solving AI tasks with ChatGPT and its friends in hugging face","venue":null,"work_id":"caf4a71f-2017-4661-925f-ff2e18afd943","year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.574133Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:23dc459bc6599b3ebb8a35eee9ead90f436bde7f6e2c33e3f262cfa6a92a74ce","observation_id":"be7924a2-302d-4d43-8cef-03592f7b667d","resolution":{"observed_at":"2026-08-10T22:59:42.167871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.12456","last_updated":"2024-12-12T12:38:12Z","snapshot_observed_at":"2026-08-13T05:00:32.918196Z","submitted_at":"2023-12-16T02:27:00Z","title":"PowerInfer: Fast Large Language Model Serving with a Consumer-grade GPU","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.12456","snapshot_observed_at":"2026-08-10T22:59:41.579934Z","title":"PowerInfer: Fast large language model serving with a consumer-grade GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.579934Z"},"links":{"cited_paper":"/paper/2312.12456","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:f2811bff54864b318aa98c370cfc63c02e8d394a62646e70b1243f5e8e7317d3","observation_id":"eb8f7b95-e03c-49a2-8f4a-3ca3c00adc85","resolution":{"observed_at":"2026-08-10T22:59:41.579934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.144386Z","title":"Hashimoto","venue":null,"work_id":"4145cb8f-97d2-4edc-b03f-780b2da0802e","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.585451Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:1a03c238983e2844c52a242f48e1db745bf29fdbb83d54e44e81750efdfdd89b","observation_id":"fba87fc4-3f3e-48c3-8199-7be765e74fe7","resolution":{"observed_at":"2026-08-10T22:59:42.151010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.125882Z","title":"NVIDIA Tesla T4","venue":null,"work_id":"d413ecfe-48eb-414c-ba0e-638e4f4e752a","year":2018},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.591163Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:0b480b052c59afd1b81ce7163ec52bab707cdcdb4ffa5c03652eb97ef8fe2d1b","observation_id":"f6ffe0fd-31f4-4bfe-8192-98fcac1e5c2e","resolution":{"observed_at":"2026-08-10T22:59:42.131793Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.108406Z","title":"NVIDIA RTX 6000 Ada Generation","venue":null,"work_id":"c2c1d983-30e2-4fe7-860e-2f916c9377c1","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.596627Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:6c39ec44e294df10312a53595b115ff5973f4029519c7722da66b275084f030b","observation_id":"63a7e315-6af4-47a2-8c1d-02942f7f7adc","resolution":{"observed_at":"2026-08-10T22:59:42.113678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-10T22:59:41.602195Z","title":"LLaMA: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.602195Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:2568e5b2539f505a7d41c39908b0b84b3131f29f2c9500440472c8763154f841","observation_id":"d449df61-6ba9-4d72-99ec-3c392337f535","resolution":{"observed_at":"2026-08-10T22:59:41.602195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03214","last_updated":"2023-11-22T07:28:19Z","snapshot_observed_at":"2026-08-13T05:57:12.152581Z","submitted_at":"2023-10-05T00:04:12Z","title":"FreshLLMs: Refreshing Large Language Models with Search Engine Augmentation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03214","snapshot_observed_at":"2026-08-10T22:59:41.607643Z","title":"FreshLLMs: Refreshing large lan- guage models with search engine augmentation","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.607643Z"},"links":{"cited_paper":"/paper/2310.03214","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:df84c9b86e1c300eec844d5166f54a65908a5ea7fb4ee1434ef47333c7c51e08","observation_id":"02d3299f-b931-4491-bc3f-442959e8924d","resolution":{"observed_at":"2026-08-10T22:59:41.607643Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.091844Z","title":"Peeling back the carbon curtain: Carbon optimization challenges in cloud computing","venue":null,"work_id":"39fc9fbc-de4b-458b-b396-8c6ca3ef8592","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.613273Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:5cc0a8bb820091274f56071fba0fcd8a6152ccbb03b6ff8238dda2388753aa9e","observation_id":"87d7fde2-a4ed-4953-be19-6b080b4fdaad","resolution":{"observed_at":"2026-08-10T22:59:42.097126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.075002Z","title":"Gen AI’s environmental ledger: A closer look at the carbon footprint of ChatGPT","venue":null,"work_id":"ac5c48a5-5dfb-4f66-b4fe-1c5ddaaa938d","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.618823Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:4a7a890025f9ff0b81de695a78c8d4b54d0ae0d7914b688950c70dbb2232d342","observation_id":"14800bd2-dc19-4eb9-837b-cc0a9272dc63","resolution":{"observed_at":"2026-08-10T22:59:42.080318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.08848","last_updated":"2023-05-15T17:59:01Z","snapshot_observed_at":"2026-08-15T10:24:13.846266Z","submitted_at":"2023-05-15T17:59:01Z","title":"Small Models are Valuable Plug-ins for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.08848","snapshot_observed_at":"2026-08-10T22:59:41.624539Z","title":"Small models are valuable plug-ins for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.624539Z"},"links":{"cited_paper":"/paper/2305.08848","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:0a13002c72bb9c18eca84eb4951b7bf300e951b309cb05cd6f01e52b8ef6dfe9","observation_id":"b7ac0204-d0ff-4dce-a4bb-e06d7a34dc26","resolution":{"observed_at":"2026-08-10T22:59:41.624539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02515","last_updated":"2024-09-18T13:07:28Z","snapshot_observed_at":"2026-08-13T18:55:32.104689Z","submitted_at":"2023-12-05T05:38:38Z","title":"mLoRA: Fine-Tuning LoRA Adapters via Highly-Efficient Pipeline Parallelism in Multiple GPUs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02515","snapshot_observed_at":"2026-08-10T22:59:41.630016Z","title":"ASPEN: High-throughput LoRA fine-tuning of large language models with a single GPU","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.630016Z"},"links":{"cited_paper":"/paper/2312.02515","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:990cc58050f88474394dbd51bbb77efcb4f30498f113d8d1960ea0088d733b3a","observation_id":"55516410-530a-45c1-90e1-374fafe0503e","resolution":{"observed_at":"2026-08-10T22:59:41.630016Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10131","last_updated":"2024-06-05T17:27:51Z","snapshot_observed_at":"2026-08-13T00:53:38.526176Z","submitted_at":"2024-03-15T09:26:02Z","title":"RAFT: Adapting Language Model to Domain Specific RAG","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.10131","snapshot_observed_at":"2026-08-10T22:59:41.636057Z","title":"Patil, Naman Jain, Sheng Shen, Matei Zaharia, Ion Stoica, and Joseph E","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.636057Z"},"links":{"cited_paper":"/paper/2403.10131","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:5c86bd4aa809d36587770bade2fc48104c83bd708e82598f0d318b450c8c6380","observation_id":"c5182538-f188-48fe-9e35-5c0c2f12a564","resolution":{"observed_at":"2026-08-10T22:59:41.636057Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T22:59:42.056602Z","title":"A GNN-based day ahead carbon intensity forecasting model for cross-border power grids","venue":null,"work_id":"3e4a4d9a-b99a-4208-a2c3-bd4eb16259f4","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.641223Z"},"links":{"citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:333cd0b75200ee8c2c4d108712d14aeb3c35c2d5137cbd92da5d7bd89a458d97","observation_id":"0c4fd526-13e3-44a6-b712-ba3d5b1ed46d","resolution":{"observed_at":"2026-08-10T22:59:42.062685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.06364","last_updated":"2023-12-11T13:20:21Z","snapshot_observed_at":"2026-08-13T05:05:09.207584Z","submitted_at":"2023-12-11T13:20:21Z","title":"Embodied Carbon Accounting through Spatial-Temporal Embodied Carbon Models","version":1},"cited_work":{"arxiv_id":"2312.06364","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.06364","snapshot_observed_at":"2026-08-10T22:59:41.708607Z","title":"Embodied Carbon Accounting through Spatial-Temporal Embodied Carbon Models","venue":"cs.AR","work_id":"f61084d7-6a64-48c3-aaad-325666dd7841","year":2023},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.646483Z"},"links":{"cited_paper":"/paper/2312.06364","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:fc791147b367f1419bb07380882ecf3c659315c2c50ece566a5c048adf1a5d04","observation_id":"7ad3930f-8210-48ee-837b-669f6b1b7e1c","resolution":{"observed_at":"2026-08-10T22:59:41.715700Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.09670","last_updated":"2024-06-06T15:50:51Z","snapshot_observed_at":"2026-08-13T23:09:00.124751Z","submitted_at":"2024-01-18T01:03:38Z","title":"DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.09670","snapshot_observed_at":"2026-08-10T22:59:41.651892Z","title":"DistServe: Disaggregating prefill and decoding for goodput- optimized large language model serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T22:59:41.651892Z"},"links":{"cited_paper":"/paper/2401.09670","citing_paper":"/paper/2501.01990"},"observation_digest":"sha256:3c44afb5dac6838a0976cbdf5863313e33c4bf8fd720b8c9371b0de8528db154","observation_id":"0f926cef-6847-43f8-bfe5-259bb2b16ab8","resolution":{"observed_at":"2026-08-10T22:59:41.651892Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.01990","last_updated":"2024-12-31T03:18:10Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-15T17:14:07.539417Z","submitted_at":"2024-12-31T03:18:10Z","title":"Towards Sustainable Large Language Model Serving"},"reference_resolution":{"displayed":40,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":27},"total_outbound_references":40},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 40 of 40 outbound references and 0 inbound Pith citation observations for arXiv:2501.01990."}