{"as_of":"2026-08-10T16:16:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c86de386d90354118d4564d45f8a425fb0517c2d81bbef0ecb7b4c917f70c788","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":7,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":7,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-10T06:31:04.303077+00:00","state":"measured"},{"denominator":7,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":7,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T18:45:04.721093Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-18T03:42:22.549226Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-08-06T18:45:04.721093Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.08877","last_updated":"2025-07-10T04:44:47Z","snapshot_observed_at":"2026-08-09T14:45:42.221113Z","submitted_at":"2025-07-10T04:44:47Z","title":"ODIA: Oriented Distillation for Inline Acceleration of LLM-based Function Calling","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T18:45:04.721093Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2507.08877"},"observation_digest":"sha256:6acab1f02765deb47f590d1633190df96bc9bf775198cc0a9f6521389a259d01","observation_id":"37e2e66c-f579-4cd9-b8ee-9d21bc856520","resolution":{"observed_at":"2026-08-06T18:45:04.721093Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-08-06T10:32:40.839088Z","title":"Sentence Transformers","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.23674","last_updated":"2025-09-10T17:59:08Z","snapshot_observed_at":"2026-08-09T13:18:19.683180Z","submitted_at":"2025-07-31T15:50:57Z","title":"TweakLLM: A Routing Architecture for Dynamic Tailoring of Cached Responses","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-06T10:32:40.839088Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2507.23674"},"observation_digest":"sha256:1af275629b564e073d22d84a9989161e9ed3797dd862380d7d7546a59a341853","observation_id":"dd1fa479-4bea-42f7-a4a2-8a36f4983d45","resolution":{"observed_at":"2026-08-06T10:32:40.839088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-08-05T14:28:40.726676Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.21307","last_updated":"2025-08-29T02:08:36Z","snapshot_observed_at":"2026-08-10T10:34:46.331993Z","submitted_at":"2025-08-29T02:08:36Z","title":"MultiFluxAI Enhancing Platform Engineering with Advanced Agent-Orchestrated Retrieval Systems","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-05T14:28:40.726676Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2508.21307"},"observation_digest":"sha256:764e156d7f0b5dec62aa361b34f8f33ede3620eaf84745e9f625bb921c1f590a","observation_id":"0d57e0b2-b785-4ebb-a02b-c5e5e30377c0","resolution":{"observed_at":"2026-08-05T14:28:40.726676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":"2411.05276","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT semantic cache: Reducing LLM costs and latency via semantic embedding caching.CoRR, abs/2411.05276","venue":null,"work_id":"bf4c3488-2ad5-44e1-aedd-fbb92f3eeced","year":2024},"citing_paper":{"arxiv_id":"2510.25401","last_updated":"2026-04-11T06:37:04Z","snapshot_observed_at":"2026-07-06T22:34:23.736456Z","submitted_at":"2025-10-29T11:20:10Z","title":"DGAI: Decoupled On-Disk Graph-Based ANN Index for Efficient Updates and Queries","version":5},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-18T03:42:04.427190Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2510.25401"},"observation_digest":"sha256:5d00a844bbcbee0af3b1f2725dbc18b204dabaa47f05c505cd130575661638f3","observation_id":"825fe018-798a-4240-8c64-edd4f94cdd4a","resolution":{"observed_at":"2026-05-18T03:42:22.551174Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-10T06:31:04.303077+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-08-03T17:21:31.510856Z","title":"CoRR , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2512.11001","last_updated":"2026-07-07T14:01:07Z","snapshot_observed_at":"2026-08-07T02:51:28.184118Z","submitted_at":"2025-12-10T20:16:20Z","title":"Rethinking Query Optimization for Multi-Agent Systems [Vision]","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T17:21:31.510856Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2512.11001"},"observation_digest":"sha256:778c8cd2e5f03d9ffbc33ca84cf774f41293375b7d14452dac7c64a4453423c3","observation_id":"a2b46e7d-c2d3-4789-9f7a-ee35225677a1","resolution":{"observed_at":"2026-08-03T17:21:31.510856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-08-03T06:17:22.298725Z","title":"and Pun, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.23088","last_updated":"2026-06-30T05:19:59Z","snapshot_observed_at":"2026-08-08T21:01:56.133157Z","submitted_at":"2026-01-30T15:37:00Z","title":"From Similarity to Vulnerability: Key Collision Attack on LLM Semantic Caching","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T06:17:22.298725Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2601.23088"},"observation_digest":"sha256:24334b8b6189364eb70f7ac11271c2c345a7da380b26d8b0f453762dddbf46fe","observation_id":"a8c85813-6a93-40e3-8fda-713bab21ce9d","resolution":{"observed_at":"2026-08-03T06:17:22.298725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.05276","snapshot_observed_at":"2026-07-12T09:50:23.266920Z","title":"P.Gpt semantic cache: Reducing llm costs and latency via semantic embedding caching.arXiv preprint arXiv:2411.05276(2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.02574","last_updated":"2026-06-30T16:12:40Z","snapshot_observed_at":"2026-07-12T09:50:22.497230Z","submitted_at":"2026-06-30T16:12:40Z","title":"From Tensor Buffer to Distributed Memory Hierarchy: A Survey of KV Cache Management for LLM Serving","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-12T09:50:23.266920Z"},"links":{"cited_paper":"/paper/2411.05276","citing_paper":"/paper/2607.02574"},"observation_digest":"sha256:537fef7070d5b909da0c128126dcfd1d467ee7995b3be928207d5209780963a7","observation_id":"42a42c12-72e9-43f7-a0bb-84c603b381ec","resolution":{"observed_at":"2026-07-12T09:50:23.266920Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2411.05276/citation-record","integrity":"/paper/2411.05276/integrity","json":"/paper/2411.05276/citation-record.json","paper":"/paper/2411.05276"},"outbound":[],"paper":{"arxiv_id":"2411.05276","last_updated":"2024-12-09T01:44:10Z","latest_version":3,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-02T07:37:21.335822Z","submitted_at":"2024-11-08T02:21:19Z","title":"GPT Semantic Cache: Reducing LLM Costs and Latency via Semantic Embedding Caching"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-10T06:31:04.303077+00:00","source":"crossref"},{"observed_at":"2026-08-10T06:30:57.382061+00:00","source":"retraction_watch"}],"thesis":"As of 10 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 7 inbound Pith citation observations for arXiv:2411.05276."}