{"as_of":"2026-08-16T19:11:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9ecff29d727cc26634837c0ad8b3d4b2c1e9103eb6ed421752f83bd3fc1fc7a2","coverage":[{"denominator":89,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":89,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T04:40:04.787699Z","state":"measured"},{"denominator":89,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":89,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-16T06:30:59.297886+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.07833/citation-record","integrity":"/paper/2505.07833/integrity","json":"/paper/2505.07833/citation-record.json","paper":"/paper/2505.07833"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.261461Z","title":"https://grpc.io/, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.261461Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:528aa20760820e05af7913d17f2a411af6359ecef607e2c0a7ad0bb1e120cfa3","observation_id":"0480d2e8-106d-459a-83a8-1f76c17d4325","resolution":{"observed_at":"2026-08-16T04:40:04.261461Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.268066Z","title":"Infercept: efficient intercept support for augmented large language model inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.268066Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:ae06b30b482a82ede76740e33df63f3216a14f9dd9fcbbdb83c487f622ba2b9a","observation_id":"87b47cea-c865-4ec5-b17b-3df01f7d7cf0","resolution":{"observed_at":"2026-08-16T04:40:04.268066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.279508Z","title":"What’s new in gurobi 9.0","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.279508Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:5c97e2afdfa2af652bae40533b1e357fc5a72ece0593699f56e368b6f904175e","observation_id":"85f9870d-eca0-4bac-92e5-d621a86044b4","resolution":{"observed_at":"2026-08-16T04:40:04.279508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16369","last_updated":"2023-08-31T00:03:02Z","snapshot_observed_at":"2026-08-15T04:42:28.752204Z","submitted_at":"2023-08-31T00:03:02Z","title":"SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16369","snapshot_observed_at":"2026-08-16T04:40:04.288007Z","title":"Sarathi: Efficient llm inference by piggybacking decodes with chunked prefills","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.288007Z"},"links":{"cited_paper":"/paper/2308.16369","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:71d19aad625a2e06ad3e3f0176ea83a903571cd84f21edeae76af91a93e75d72","observation_id":"81f62ec3-5d84-4aed-a8da-f5ebdb970fda","resolution":{"observed_at":"2026-08-16T04:40:04.288007Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.296338Z","title":"Programming with legion","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.296338Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:56981eff231c3fa4d6ca31f1daef793a57460326f0ae55417009207bb2ced93c","observation_id":"966905e3-01a9-496a-b02c-c43b34009d9e","resolution":{"observed_at":"2026-08-16T04:40:04.296338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.303671Z","title":"Improving lan- guage models by retrieving from trillions of tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.303671Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:eb4d621b32ea1e318baecc34acbdbb8a72db9b5bd2ecd400a4d84dd3b02798a1","observation_id":"fe05ce2a-03d6-4103-95a9-b6593c32820c","resolution":{"observed_at":"2026-08-16T04:40:04.303671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.00610","last_updated":"2024-03-31T08:58:54Z","snapshot_observed_at":"2026-08-16T14:04:53.635805Z","submitted_at":"2024-03-31T08:58:54Z","title":"RQ-RAG: Learning to Refine Queries for Retrieval Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.00610","snapshot_observed_at":"2026-08-16T04:40:04.311048Z","title":"Rq-rag: Learning to refine queries for retrieval augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.311048Z"},"links":{"cited_paper":"/paper/2404.00610","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:5826043e0c7e250bd65f10e0f53e189063a5233e512bcdd78c078cc706320dae","observation_id":"bacffb9e-e8fd-49ce-a0d0-32d5ca798013","resolution":{"observed_at":"2026-08-16T04:40:04.311048Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.316474Z","title":"Lire: Efficient query rewriting for re- trieval augmented generation systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.316474Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:0ba418f6b26a0a4de83364eb0c009e96eebedaa9d64b2916a7bd655a6248e79b","observation_id":"c2868bcf-0928-43e9-abfd-557519f96b81","resolution":{"observed_at":"2026-08-16T04:40:04.316474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.321800Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.321800Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:ca5487836e35209bedd19d75f23ac027a0376c5065dc09cd6e5e62b0c36a8ab9","observation_id":"d16ba18f-498d-40bf-8243-3b66ba97baa3","resolution":{"observed_at":"2026-08-16T04:40:04.321800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.328120Z","title":"Xgboost: A scalable tree boosting system","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.328120Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:187b3b36914adc45d2780fb4c07e7a24fbbc298329ca37a3af594dbd2d6c1504","observation_id":"872d91e7-9d31-43eb-a149-f470a3cc49dc","resolution":{"observed_at":"2026-08-16T04:40:04.328120Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01767","last_updated":"2026-07-13T08:44:15Z","snapshot_observed_at":"2026-08-16T14:22:40.503018Z","submitted_at":"2024-02-01T02:24:15Z","title":"HiQA: A Hierarchical Contextual Augmentation RAG for Multi-Documents QA","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01767","snapshot_observed_at":"2026-08-16T04:40:04.333272Z","title":"Hiqa: A hierarchical contextual augmentation rag for multi-documents qa","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.333272Z"},"links":{"cited_paper":"/paper/2402.01767","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:7f4b54a24efe61f742a0239fa80031d03f98607f0e6fb0692fa1b6aea7ad9131","observation_id":"6b19faf4-2332-440b-a10a-c760c0bdcdaa","resolution":{"observed_at":"2026-08-16T04:40:04.333272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.338828Z","title":"Llm-inference-bench: Inference benchmarking of large language models on ai accelerators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.338828Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4c6f51424257f92d17c8eb134ac1b019f461fe2874242325245630221a0d3746","observation_id":"8ff8f5b7-9eca-4e70-9ed2-d8dc9b13b80b","resolution":{"observed_at":"2026-08-16T04:40:04.338828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.498340Z","title":"Lazybatching: An sla-aware batching system for cloud machine learning inference, 2020","venue":null,"work_id":"743f9ccf-9491-4248-a7a7-0735e62d2aa6","year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.344185Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:949cd620652cbeef5a7b9d4452aa3d796a483dd8caf9b52a0ad63821f88e9391","observation_id":"e9b0ca4a-0c47-417e-9cf5-d91560a4f9cb","resolution":{"observed_at":"2026-08-16T04:40:06.508133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.473436Z","title":"https://github.com/ chroma-core/chroma","venue":null,"work_id":"d2a04fbb-de63-4df5-874e-8a299b4826ff","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.349429Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:5e578d8d88775dca54da18e370d539795fdf4cc6ab290b9378f3baba37e45e8e","observation_id":"d96d695b-04f2-41f9-8688-22f7d57ee945","resolution":{"observed_at":"2026-08-16T04:40:06.479660Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.356160Z","title":"Clipper: A{Low-Latency} online prediction serving system","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.356160Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:985827283c0f687ef0ea15f8303f3c42fc1177db00b8068d70db61205627dd2e","observation_id":"38586f25-f17a-4230-a053-4f724788060a","resolution":{"observed_at":"2026-08-16T04:40:04.356160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.443171Z","title":"Mapreduce: simplified data pro- cessing on large clusters","venue":null,"work_id":"b951297c-52a1-4f7f-9df4-7a15be94a8ca","year":2008},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.362538Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:b9964637707d9a65712bb573032a29882854a40451a9247a87a8ae8a733ef189","observation_id":"9e0df209-7ed1-4cc7-94b0-ea6121bf3731","resolution":{"observed_at":"2026-08-16T04:40:06.448239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16130","last_updated":"2025-02-19T10:49:41Z","snapshot_observed_at":"2026-08-16T12:38:40.131901Z","submitted_at":"2024-04-24T18:38:11Z","title":"From Local to Global: A Graph RAG Approach to Query-Focused Summarization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16130","snapshot_observed_at":"2026-08-16T04:40:04.373824Z","title":"From local to global: A graph rag approach to query-focused summarization","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.373824Z"},"links":{"cited_paper":"/paper/2404.16130","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:3f6a5854d5983cd6e681cf1dd3c62f2805720c264f5b522953db279cf6e7564f","observation_id":"4bfec62a-cd14-45c0-ba84-c0030a34bf4c","resolution":{"observed_at":"2026-08-16T04:40:04.373824Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.18397","last_updated":"2025-02-25T17:47:53Z","snapshot_observed_at":"2026-08-16T12:55:17.323310Z","submitted_at":"2025-02-25T17:47:53Z","title":"KiRAG: Knowledge-Driven Iterative Retriever for Enhancing Retrieval-Augmented Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.18397","snapshot_observed_at":"2026-08-16T04:40:04.380147Z","title":"Kirag: Knowledge- driven iterative retriever for enhancing retrieval-augmented genera- tion","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.380147Z"},"links":{"cited_paper":"/paper/2502.18397","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:871e1808e5df90eff98829f977dac68746a162c038342235008b99099ca6850f","observation_id":"a3d065ee-fdac-4d2e-836d-7755387e1339","resolution":{"observed_at":"2026-08-16T04:40:04.380147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07483","last_updated":"2024-06-06T14:42:47Z","snapshot_observed_at":"2026-08-16T14:19:25.136692Z","submitted_at":"2024-02-12T08:45:08Z","title":"T-RAG: Lessons from the LLM Trenches","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07483","snapshot_observed_at":"2026-08-16T04:40:04.386092Z","title":"T-rag: lessons from the llm trenches","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.386092Z"},"links":{"cited_paper":"/paper/2402.07483","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:f8010a73d9e7f82dcd88d128ceb2a8682bffeb85e6e1aa4518fdf2a023c09bb9","observation_id":"3969794f-a71e-47f2-9710-28c2c19b8e6a","resolution":{"observed_at":"2026-08-16T04:40:04.386092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18344","last_updated":"2023-10-22T14:45:14Z","snapshot_observed_at":"2026-08-16T14:50:01.516450Z","submitted_at":"2023-10-22T14:45:14Z","title":"Chainpoll: A high efficacy method for LLM hallucination detection","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18344","snapshot_observed_at":"2026-08-16T04:40:04.394614Z","title":"Chainpoll: A high efficacy method for llm hallucination detection","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.394614Z"},"links":{"cited_paper":"/paper/2310.18344","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:c2438b26573b15abf9fe4f8966988dc9814b1a7daa7f473cb165a11e96437483","observation_id":"5982065e-aeea-4bbc-85b2-d3b902d91787","resolution":{"observed_at":"2026-08-16T04:40:04.394614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.422569Z","title":"Dominant resource fairness: Fair allocation of multiple resource types","venue":null,"work_id":"ee18121c-c8f1-4f70-ab53-c983afc7afa3","year":2011},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.402970Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:6e9bf7122d2cda63df5bd416585e77c578d73430899bd47ef3988a08b945c68a","observation_id":"3cd6b6c9-2136-4ace-ab7a-e059cfe4ad25","resolution":{"observed_at":"2026-08-16T04:40:06.429178Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.396674Z","title":"Serving {DNNs} like clockwork: Performance predictability from the bottom up","venue":null,"work_id":"0bffdaad-b495-4d07-81c5-644408279aad","year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.411071Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:24cb2492a20d8ec125495d2746a37b7913731241113ee335993dcb58c1818f08","observation_id":"47e8c3fb-8115-4cad-97f5-5259d393d5ad","resolution":{"observed_at":"2026-08-16T04:40:06.405137Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.371891Z","title":"Accelerating large-scale inference with anisotropic vector quantization","venue":null,"work_id":"a9dfb76e-1c0a-4430-a7b3-e6767f8962e3","year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.416570Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:c3f72eeaea6af720c8574981e6e6b8001e8d6c1d83d78a7ab48f7f0a35b8f012","observation_id":"d1e3e448-832b-4a24-8077-a44f5135071a","resolution":{"observed_at":"2026-08-16T04:40:06.378009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.339123Z","title":"Hipporag: Neurobiologically inspired long-term memory for large language models","venue":null,"work_id":"bddbe30d-d0cf-4264-a028-024d1d435795","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.422411Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:d8e84df81488bd9c46ecf47b876caa4e22672cdf34669282e18f10c4c03c839e","observation_id":"601abd6f-0926-434b-b173-0773b9221642","resolution":{"observed_at":"2026-08-16T04:40:06.344872Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.320217Z","title":"Hipporag: Neurobiologically inspired long-term memory for large language models, 2025","venue":null,"work_id":"b9d90791-0b1e-4605-b302-ba11ddbaddac","year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.427796Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:c58889dfa35c1e2f97367d7ed82a8d2b304c8461381ad617ef090b57fde4588e","observation_id":"5b59579f-e527-4887-ae78-191cec470181","resolution":{"observed_at":"2026-08-16T04:40:06.325670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.00309","last_updated":"2025-01-08T05:16:25Z","snapshot_observed_at":"2026-08-15T15:30:31.504538Z","submitted_at":"2024-12-31T06:59:35Z","title":"Retrieval-Augmented Generation with Graphs (GraphRAG)","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.00309","snapshot_observed_at":"2026-08-16T04:40:04.433410Z","title":"Retrieval-augmented generation with graphs (graphrag)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.433410Z"},"links":{"cited_paper":"/paper/2501.00309","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:530aa5617d0f25a2ee41a3deb258cf5d012b9bc42a7f4954318eca45ea45beed","observation_id":"a4294cf2-6451-4ec3-9b4a-11270090e3ff","resolution":{"observed_at":"2026-08-16T04:40:04.433410Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.04761","last_updated":"2025-02-11T00:46:43Z","snapshot_observed_at":"2026-08-16T00:24:39.803404Z","submitted_at":"2025-02-11T00:46:43Z","title":"Which Economic Tasks are Performed with AI? Evidence from Millions of Claude Conversations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.04761","snapshot_observed_at":"2026-08-16T04:40:04.439592Z","title":"Which economic tasks are performed with ai? evidence from millions of claude conversations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.439592Z"},"links":{"cited_paper":"/paper/2503.04761","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4d69f65462f5e4cb7853993540b36f86c3dfe798d38a26794bc709934f5b1ef0","observation_id":"6800c883-0114-4076-983b-008334cc0724","resolution":{"observed_at":"2026-08-16T04:40:04.439592Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.300300Z","title":"MOSEL: Inference serving using dynamic modality selec- tion","venue":null,"work_id":"537c0a19-874a-4792-bd9e-5866c9bcd50c","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.446275Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:e0dc029f278854a385067f18c3cf484e1b0fb7b73fc866622736ca9bc61d3dc8","observation_id":"8c0a8b22-bb5b-47de-aa80-23ac4f533e69","resolution":{"observed_at":"2026-08-16T04:40:06.307531Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.14649","last_updated":"2025-03-21T17:51:53Z","snapshot_observed_at":"2026-08-16T12:48:51.436408Z","submitted_at":"2025-03-18T18:58:13Z","title":"RAGO: Systematic Performance Optimization for Retrieval-Augmented Generation Serving","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.14649","snapshot_observed_at":"2026-08-16T04:40:04.457808Z","title":"Rago: Systematic performance op- timization for retrieval-augmented generation serving","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.457808Z"},"links":{"cited_paper":"/paper/2503.14649","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:b8a55f83aa7593c930774e7fe486f450b23977ff1fb1d28a639ce4cacfed6840","observation_id":"9a31c2f9-5537-451d-8b58-e0f51729b5b3","resolution":{"observed_at":"2026-08-16T04:40:04.457808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09949","last_updated":"2025-03-24T18:01:48Z","snapshot_observed_at":"2026-08-16T14:51:58.451531Z","submitted_at":"2023-10-15T20:57:25Z","title":"Chameleon: a Heterogeneous and Disaggregated Accelerator System for Retrieval-Augmented Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09949","snapshot_observed_at":"2026-08-16T04:40:04.464445Z","title":"Chameleon: a heterogeneous and disaggregated acceler- ator system for retrieval-augmented language models","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.464445Z"},"links":{"cited_paper":"/paper/2310.09949","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:77b776ae6efa08472db79252f9f1cc2e0aa73882a0d1a772e5755903d5b8ef91","observation_id":"8b79768f-e2fc-4e50-b215-73d0c07ce3dd","resolution":{"observed_at":"2026-08-16T04:40:04.464445Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05676","last_updated":"2024-03-08T21:09:20Z","snapshot_observed_at":"2026-08-16T14:11:29.833972Z","submitted_at":"2024-03-08T21:09:20Z","title":"PipeRAG: Fast Retrieval-Augmented Generation via Algorithm-System Co-design","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05676","snapshot_observed_at":"2026-08-16T04:40:04.470123Z","title":"Piperag: Fast retrieval-augmented generation via algorithm- system co-design","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.470123Z"},"links":{"cited_paper":"/paper/2403.05676","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:824543206c0a51a757064b57c371e8e252f8b6a943399a087c79170fed1576ef","observation_id":"7ebfefd1-a91b-49bb-8216-e347fa90ff5b","resolution":{"observed_at":"2026-08-16T04:40:04.470123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.475868Z","title":"Active retrieval augmented generation","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.475868Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:f8d7e7251cc69a1d1cfd589dafb39258e51df9f6d3fc566716fa410193ac46ab","observation_id":"400ad052-cf0b-4a6b-bbdb-03a76ba5a067","resolution":{"observed_at":"2026-08-16T04:40:04.475868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13576","last_updated":"2025-02-24T02:46:52Z","snapshot_observed_at":"2026-08-16T13:50:39.200136Z","submitted_at":"2024-05-22T12:12:40Z","title":"FlashRAG: A Modular Toolkit for Efficient Retrieval-Augmented Generation Research","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13576","snapshot_observed_at":"2026-08-16T04:40:04.482339Z","title":"Flashrag: A modular toolkit for efficient retrieval-augmented generation research","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.482339Z"},"links":{"cited_paper":"/paper/2405.13576","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:1112db5de4e9dbbf08a82128ee24483044dcdcebb5f0bb1528ba8fea4963ab3a","observation_id":"df8e8a23-abf1-4809-8dda-486c8ceb0011","resolution":{"observed_at":"2026-08-16T04:40:04.482339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.257575Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":"79584eb1-35a4-4316-a585-50330085e480","year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.487592Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:5970c4b1369eecc58423436880058905980cb8a29b65e50530e9e83ac9b874e8","observation_id":"af1aba66-2013-49c6-9be2-f5b4181967c7","resolution":{"observed_at":"2026-08-16T04:40:06.262401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.241257Z","title":"https: //www.langchain.com/langgraph","venue":null,"work_id":"527e251d-8410-4ad8-99c7-27ed0f3e64e2","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.493698Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:a8262dd65dced83a25e6e7a09699479c532b8f633ee2668a80c5c485dc4eecee","observation_id":"08c53ec4-5543-4b77-9b66-fbde3b247873","resolution":{"observed_at":"2026-08-16T04:40:06.246570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.225599Z","title":"Pre-training via paraphrasing","venue":null,"work_id":"c695471b-d0a1-4f97-a455-7a52816b69e7","year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.499034Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:610bf81d34de8d284989bc76534145d6e20569c0c58693f5a19d36721cde1c52","observation_id":"756e2512-3bf2-4e1e-9d52-a6d6be35a141","resolution":{"observed_at":"2026-08-16T04:40:06.230614Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.503739Z","title":"Retrieval-augmented generation for knowledge- intensive nlp tasks","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.503739Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:a1f071a122d15ec6a14377b2eee39f8d047a4dcbb8021c7b1eb2a8a43e4fd487","observation_id":"660f2646-74e7-4f84-a952-7e0e4e360aa8","resolution":{"observed_at":"2026-08-16T04:40:04.503739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.13154","last_updated":"2024-11-20T09:43:30Z","snapshot_observed_at":"2026-08-13T12:00:36.687070Z","submitted_at":"2024-11-20T09:43:30Z","title":"DMQR-RAG: Diverse Multi-Query Rewriting for RAG","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.13154","snapshot_observed_at":"2026-08-16T04:40:04.510602Z","title":"Dmqr-rag: Diverse multi-query rewriting for rag","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.510602Z"},"links":{"cited_paper":"/paper/2411.13154","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:1dd9a82061b7c93aea9d3ed5071ca350239c405123317f51f89711af3021f75f","observation_id":"6d3e35de-7ded-40a9-8eef-b33eb6f88eb9","resolution":{"observed_at":"2026-08-16T04:40:04.510602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.516531Z","title":"Cft-rag: An entity tree based retrieval augmented generation algorithm with cuckoo filter","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.516531Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:75b0dac466fc9c7e3809d3444345ad5b392352d4cd25017c18e889ef67e80f62","observation_id":"96b30856-9e07-4731-b0df-4c7c6676e938","resolution":{"observed_at":"2026-08-16T04:40:04.516531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.12144","last_updated":"2022-07-24T04:54:17Z","snapshot_observed_at":"2026-08-16T18:00:36.857774Z","submitted_at":"2021-08-27T07:22:55Z","title":"Lyra: A Benchmark for Turducken-Style Code Generation","version":3},"cited_work":{"arxiv_id":"2108.12144","doi":null,"metadata_source":"pith","pith_arxiv_id":"2108.12144","snapshot_observed_at":"2026-08-16T04:40:05.308566Z","title":"Lyra: A Benchmark for Turducken-Style Code Generation","venue":"cs.SE","work_id":"a745e0e4-0152-46ba-af06-8b6f64c4f179","year":2021},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.521482Z"},"links":{"cited_paper":"/paper/2108.12144","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:0459473c529c482aeceaabe791f583f974c44821fca825a6c2162904537e9aea","observation_id":"1d78fbc1-f13e-4f76-9b56-b47f321e7b8b","resolution":{"observed_at":"2026-08-16T04:40:05.316490Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.18636","last_updated":"2025-02-23T10:46:28Z","snapshot_observed_at":"2026-08-16T12:58:34.525704Z","submitted_at":"2025-01-28T17:01:31Z","title":"SafeRAG: Benchmarking Security in Retrieval-Augmented Generation of Large Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.18636","snapshot_observed_at":"2026-08-16T04:40:04.530104Z","title":"Saferag: Benchmarking security in retrieval-augmented genera- tion of large language model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.530104Z"},"links":{"cited_paper":"/paper/2501.18636","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:09d7fbdbd0f241b09798efc0941266526c0b5a76f51a4bc40cd453bf06cd8409","observation_id":"ad6e1feb-494d-41a6-8e98-4302eca50474","resolution":{"observed_at":"2026-08-16T04:40:04.530104Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.20969","last_updated":"2026-05-18T17:02:34Z","snapshot_observed_at":"2026-08-14T04:50:44.159495Z","submitted_at":"2025-02-28T11:32:22Z","title":"TeleRAG: Efficient Retrieval-Augmented Generation Inference with Lookahead Retrieval","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.20969","snapshot_observed_at":"2026-08-16T04:40:04.535865Z","title":"Telerag: Efficient retrieval-augmented generation inference with lookahead retrieval","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.535865Z"},"links":{"cited_paper":"/paper/2502.20969","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:9a539c332e594be19a37116f94298191ba89fd54e1b7ef1f4678dbabc8caee41","observation_id":"c9e38208-24c6-4f7f-9f16-d6c84ad8be77","resolution":{"observed_at":"2026-08-16T04:40:04.535865Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.12442","last_updated":"2025-05-26T03:17:07Z","snapshot_observed_at":"2026-08-16T17:16:23.196808Z","submitted_at":"2025-02-18T02:24:42Z","title":"HopRAG: Multi-Hop Reasoning for Logic-Aware Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.12442","snapshot_observed_at":"2026-08-16T04:40:04.541391Z","title":"Hoprag: Multi-hop reasoning for logic-aware retrieval-augmented generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.541391Z"},"links":{"cited_paper":"/paper/2502.12442","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:9ac8ed7d50e1131a4152bef069ca74e3988a13015cac399054f1bbb7771faf04","observation_id":"1d350887-30a9-4832-814c-7c249bc2773b","resolution":{"observed_at":"2026-08-16T04:40:04.541391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.196934Z","title":"https://github.com/ggml-org/llama.cpp","venue":null,"work_id":"6680cde8-1540-4a35-a801-a55924494809","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.548419Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:0d448355d5957302f80eb406686ca9b6b47973989365bd32ad7f3cea54dcce8d","observation_id":"79888576-0285-4cb8-ba30-8a1750943adb","resolution":{"observed_at":"2026-08-16T04:40:06.204412Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.555085Z","title":"Query rewriting in retrieval-augmented large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.555085Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:ad8a122b724a9146287dd3ebb9bd08d588ae350a5524708bd68f22a98f14fa44","observation_id":"a08988d7-08fb-42d4-94aa-c44923cd2916","resolution":{"observed_at":"2026-08-16T04:40:04.555085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.169172Z","title":"Luminirag: Vision-enhanced graph rag for complex multi-modal document understanding","venue":null,"work_id":"5329cbd0-3aec-40d2-a311-eb18a231cb3e","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.560428Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:851c2d8bb5cbb126648536cb955a9f951cafb2120daa88a734acb87e0234ba89","observation_id":"07154bd2-33a6-4511-b758-219cc2c05447","resolution":{"observed_at":"2026-08-16T04:40:06.173894Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01566","last_updated":"2025-03-05T20:00:57Z","snapshot_observed_at":"2026-08-16T13:46:36.936618Z","submitted_at":"2024-06-03T17:47:53Z","title":"Helix: Serving Large Language Models over Heterogeneous GPUs and Network via Max-Flow","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01566","snapshot_observed_at":"2026-08-16T04:40:04.566083Z","title":"Helix: Serving large language models over heterogeneous gpus and network via max-flow","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.566083Z"},"links":{"cited_paper":"/paper/2406.01566","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:d2e8a31e47d4d63dd34c35049c53a6d3f904561baf0760ad82d748069d8399a1","observation_id":"bee64b80-c58e-449c-91a5-cdef69b47ff3","resolution":{"observed_at":"2026-08-16T04:40:04.566083Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.150903Z","title":"Mllib: Machine learning in apache spark","venue":null,"work_id":"24b35c28-553d-4d47-bc1a-62902d64c763","year":2016},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.574324Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:a61d243cc61ccb18e1b76537eccdff7c8b0e110d06f2c919ffbd7c0dcfe7eb3b","observation_id":"44bd4015-5e3a-4056-9413-f562359e5fc3","resolution":{"observed_at":"2026-08-16T04:40:06.156742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.580156Z","title":"Sosecure: Safer code generation with rag and stackoverflow discussions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.580156Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:e89215c3e107a7ce8583cfb1f16920ce1711e28e1098e1db0bdc794f22d69b8a","observation_id":"6173bb5b-dead-4e18-ac3f-77a16766373f","resolution":{"observed_at":"2026-08-16T04:40:04.580156Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.585672Z","title":"{Heterogeneity-Aware} cluster scheduling policies for deep learning workloads","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.585672Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:90db9e9abf55090c691f7520795e2189ad51deec92343953b868ee639df6a4a6","observation_id":"d5c2e7f5-9762-40d5-a8fa-4a69151d6750","resolution":{"observed_at":"2026-08-16T04:40:04.585672Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08444","last_updated":"2025-04-25T18:01:29Z","snapshot_observed_at":"2026-08-16T18:19:11.260819Z","submitted_at":"2024-08-15T22:34:44Z","title":"W-RAG: Weakly Supervised Dense Retrieval in RAG for Open-domain Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08444","snapshot_observed_at":"2026-08-16T04:40:04.590425Z","title":"W-rag: Weakly supervised dense retrieval in rag for open-domain question answering","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.590425Z"},"links":{"cited_paper":"/paper/2408.08444","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4df86cb30accaeb6faec7c2cd56f0444afddaa5638fe02a045782601ef4062e2","observation_id":"4060c2d9-12ea-42ad-9270-882ec6f50c45","resolution":{"observed_at":"2026-08-16T04:40:04.590425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.06856","last_updated":"2024-05-11T00:00:23Z","snapshot_observed_at":"2026-08-16T13:53:36.560850Z","submitted_at":"2024-05-11T00:00:23Z","title":"Aladdin: Joint Placement and Scaling for SLO-Aware LLM Serving","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.06856","snapshot_observed_at":"2026-08-16T04:40:04.595609Z","title":"Aladdin: Joint placement and scaling for slo-aware llm serving","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.595609Z"},"links":{"cited_paper":"/paper/2405.06856","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:29c82929b8b5454022a7e2129ad437be3d7c3cf2ae796606267a26d89180a621","observation_id":"2f32610f-6597-48bc-a4ae-50505ff32eea","resolution":{"observed_at":"2026-08-16T04:40:04.595609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.117003Z","title":"Fastertransformer","venue":null,"work_id":"35ffbcc1-8fa7-464a-a337-ad1c359adb04","year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.600724Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:e49f6a30c04096e39dda958df5fe149436f8c2ae1798d6df0e5feab472e6fca5","observation_id":"1fd35576-d9d3-4e2a-b9e4-a4b2b763d2d8","resolution":{"observed_at":"2026-08-16T04:40:06.122359Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.096868Z","title":"https://github.com/digithree/ollama-rag","venue":null,"work_id":"1e3d43cb-c473-4a13-ae3c-9ca3021ec97b","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.606682Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:d1db68c42f4548374f32a14d0c5775afdfd9caf5865680ab89dddf2b8441631c","observation_id":"e1a2a7a0-8589-4c17-95b9-0d7a3176f93c","resolution":{"observed_at":"2026-08-16T04:40:06.102901Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.613290Z","title":"Automatic differentiation in pytorch","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.613290Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:762cb1e1aabc5e71051ff9258afd86e7b2dacb4e52485cb5b5c90631056a95f1","observation_id":"5be3f135-7410-4c98-9307-5549ffe3273d","resolution":{"observed_at":"2026-08-16T04:40:04.613290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.056413Z","title":"https://peps","venue":null,"work_id":"ff0f45d0-4caa-4172-a93f-2480fad7e506","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.618869Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4d5644359f351a748306d341c1fbcb94c95829733ee80e8393f37d5a40f3ed51","observation_id":"8e29e67f-5e8e-49fe-a5e1-7f2324d7e14b","resolution":{"observed_at":"2026-08-16T04:40:06.062588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.10343","last_updated":"2024-08-19T18:30:18Z","snapshot_observed_at":"2026-08-16T13:25:24.761276Z","submitted_at":"2024-08-19T18:30:18Z","title":"LegalBench-RAG: A Benchmark for Retrieval-Augmented Generation in the Legal Domain","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.10343","snapshot_observed_at":"2026-08-16T04:40:04.624736Z","title":"Legalbench-rag: A bench- mark for retrieval-augmented generation in the legal domain","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.624736Z"},"links":{"cited_paper":"/paper/2408.10343","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:b6b59f119af3d77eec8df018cb867bd05e79197cb8e18262b3a83c0acd47c5d7","observation_id":"121fba99-3797-47db-8605-b6396e9c6612","resolution":{"observed_at":"2026-08-16T04:40:04.624736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.05591","last_updated":"2025-04-09T09:09:37Z","snapshot_observed_at":"2026-08-16T13:20:09.779414Z","submitted_at":"2024-09-09T13:20:31Z","title":"MemoRAG: Boosting Long Context Processing with Global Memory-Enhanced Retrieval Augmentation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.05591","snapshot_observed_at":"2026-08-16T04:40:04.630238Z","title":"Memorag: Moving towards next-gen rag via memory-inspired knowledge discovery","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.630238Z"},"links":{"cited_paper":"/paper/2409.05591","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:2319cd9df19ee56d1855055fb001cdd689e0545fdf5ad363a1e27bef459a083f","observation_id":"c8ef819c-5c5c-42dd-94a0-96ba64d635f6","resolution":{"observed_at":"2026-08-16T04:40:04.630238Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1606.05250","last_updated":"2016-10-11T02:42:36Z","snapshot_observed_at":"2026-08-15T14:23:50.348670Z","submitted_at":"2016-06-16T16:36:00Z","title":"SQuAD: 100,000+ Questions for Machine Comprehension of Text","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1606.05250","snapshot_observed_at":"2026-08-16T04:40:04.635383Z","title":"Squad: 100,000+ questions for machine comprehension of text","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.635383Z"},"links":{"cited_paper":"/paper/1606.05250","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:b7fb4834333874d6a1343614a9fe537f4042fec07f6e99d7f29a86974a15ab30","observation_id":"12894818-0487-4539-9a45-3ecee558c121","resolution":{"observed_at":"2026-08-16T04:40:04.635383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.639855Z","title":"Ragserve: Fast quality- aware rag systems with configuration adaptation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.639855Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:e56889860516078c71c8fb05410d6075ea0a98e701fa319a1b075009a2463921","observation_id":"f5f08244-6cb2-4cc1-adad-ec42e846a3b7","resolution":{"observed_at":"2026-08-16T04:40:04.639855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.033541Z","title":"{INFaaS}: Automated model-less inference serving","venue":null,"work_id":"6e67e8cc-a96e-45fb-b1c2-5727142f48e0","year":2021},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.644844Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:a72c521912430f13463dd8533f1118cbba467a15bde6eaf82decd700e31405e8","observation_id":"b5dcc81c-04b3-4bc1-9c90-ef2bb393d265","resolution":{"observed_at":"2026-08-16T04:40:06.040475Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:06.011662Z","title":"Scaling retrieval-based language models with a trillion-token datastore","venue":null,"work_id":"14ea9275-2874-4864-8485-1952c01454fa","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.649163Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:facff6832c44c1874690c88bec63192958409d05e2ede75ee22137eaaf52d791","observation_id":"26876c39-44b5-4837-b6be-d09ef05a4c35","resolution":{"observed_at":"2026-08-16T04:40:06.018728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.991373Z","title":"Nexus: A gpu cluster engine for accelerating dnn-based video analysis","venue":null,"work_id":"c183ef2d-5db2-438e-80d2-fff46b3cb213","year":2019},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.653886Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:58d1b6ff915288e49991504f7d4bd5efd4d0a33455f9d14f35e36ebdc85f55b7","observation_id":"bf8dbfce-5e62-4106-9579-b16deb876ec1","resolution":{"observed_at":"2026-08-16T04:40:05.997795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.973433Z","title":"Flexgen: high-throughput generative inference of large language mod- els with a single gpu","venue":null,"work_id":"e997f7d5-8bb0-42ce-a9ec-754bac24a1b5","year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.659559Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:18d398c48a772213f9a2da425a7abd3ccdd5a1a5512e0854adbbd765b5fa8fb5","observation_id":"7913936e-f91e-45a8-89b6-ae3c5226b420","resolution":{"observed_at":"2026-08-16T04:40:05.979042Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10670","last_updated":"2024-07-15T12:35:00Z","snapshot_observed_at":"2026-08-16T13:34:10.970085Z","submitted_at":"2024-07-15T12:35:00Z","title":"Enhancing Retrieval and Managing Retrieval: A Four-Module Synergy for Improved Quality and Efficiency in RAG Systems","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10670","snapshot_observed_at":"2026-08-16T04:40:04.664531Z","title":"Enhancing retrieval and managing retrieval: A four-module synergy for improved quality and efficiency in rag systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.664531Z"},"links":{"cited_paper":"/paper/2407.10670","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:18de4081890715acf17743515313ffd386e705d0d687eda770e7183516a96fd5","observation_id":"586e5631-77df-49f0-819c-fd81d9e1ab15","resolution":{"observed_at":"2026-08-16T04:40:04.664531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19572","last_updated":"2025-04-23T06:29:39Z","snapshot_observed_at":"2026-08-16T13:05:56.590359Z","submitted_at":"2024-10-25T14:07:53Z","title":"ChunkRAG: Novel LLM-Chunk Filtering Method for RAG Systems","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19572","snapshot_observed_at":"2026-08-16T04:40:04.670737Z","title":"Chunkrag: Novel llm-chunk filtering method for rag systems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.670737Z"},"links":{"cited_paper":"/paper/2410.19572","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:99d10964a77a4b806fea00c550122bddd1f989b2f9ce854634c2e31454ef55af","observation_id":"c00f0ed5-62b8-462c-aff0-d3ca2e617aee","resolution":{"observed_at":"2026-08-16T04:40:04.670737Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.951702Z","title":"The hippocampal memory indexing theory","venue":null,"work_id":"7bb040b5-7f97-4ef8-abcd-5a52b06a14a4","year":1986},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.676078Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:d7d1fa29e29ee1bd34d6146fe7f3e211c3a9d2e71e04e361605f7b40199ae5d7","observation_id":"95aa3256-f70e-4aea-a9b0-08f7e75a74fa","resolution":{"observed_at":"2026-08-16T04:40:05.958418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10509","last_updated":"2023-06-23T00:59:13Z","snapshot_observed_at":"2026-08-15T17:29:02.957931Z","submitted_at":"2022-12-20T18:26:34Z","title":"Interleaving Retrieval with Chain-of-Thought Reasoning for Knowledge-Intensive Multi-Step Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10509","snapshot_observed_at":"2026-08-16T04:40:04.682085Z","title":"Interleaving retrieval with chain-of-thought reason- ing for knowledge-intensive multi-step questions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.682085Z"},"links":{"cited_paper":"/paper/2212.10509","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:b68e023c26d7720a3a789d115f8801b4fa7ea9d37f370d891d5a15480cbdd2dc","observation_id":"7ccea840-e13a-4ad4-ab27-4a4c6cf51729","resolution":{"observed_at":"2026-08-16T04:40:04.682085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.687906Z","title":"Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.687906Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:98c5acca94ebf763ca873bcaa529a42c1f09f1b86f4f5136007b2538939c000b","observation_id":"f3b41878-2820-46fa-803b-f8fbc093b328","resolution":{"observed_at":"2026-08-16T04:40:04.687906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.916180Z","title":"Interleaving retrieval with chain-of-thought reasoning for knowledge-intensive multi-step questions","venue":null,"work_id":"21251ee0-7f8b-4b02-bcc2-86bc54ec0ade","year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.692677Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:545401f8ceca021a4715c23a8ae3b9b8904cc6f8c71fcd2682cf892fb1fea16a","observation_id":"4b6c6681-c458-4aef-9c09-b5bdbbab70b2","resolution":{"observed_at":"2026-08-16T04:40:05.922090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07713","last_updated":"2024-05-29T04:15:39Z","snapshot_observed_at":"2026-08-16T14:52:58.002367Z","submitted_at":"2023-10-11T17:59:05Z","title":"InstructRetro: Instruction Tuning post Retrieval-Augmented Pretraining","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07713","snapshot_observed_at":"2026-08-16T04:40:04.697480Z","title":"Instructretro: Instruction tuning post retrieval-augmented pretraining","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.697480Z"},"links":{"cited_paper":"/paper/2310.07713","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:438ae828893ce9a910cfc3858b07df53a9153e211abf1eacc0757997366e0437","observation_id":"0a3f5792-bb55-4e1a-97ac-7a440cf04e6e","resolution":{"observed_at":"2026-08-16T04:40:04.697480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.12566","last_updated":"2024-10-01T04:42:48Z","snapshot_observed_at":"2026-08-16T13:41:51.348544Z","submitted_at":"2024-06-18T12:52:51Z","title":"RichRAG: Crafting Rich Responses for Multi-faceted Queries in Retrieval-Augmented Generation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.12566","snapshot_observed_at":"2026-08-16T04:40:04.703888Z","title":"Richrag: Crafting rich responses for multi- faceted queries in retrieval-augmented generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.703888Z"},"links":{"cited_paper":"/paper/2406.12566","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4b3d56b5a9aa4aa3c500e550bafb69fcb1f3daef56bd5c4d28bf39dc5c48e1e6","observation_id":"4085768a-b00e-4f53-bc4c-7d8cc79a94b5","resolution":{"observed_at":"2026-08-16T04:40:04.703888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08223","last_updated":"2025-02-27T19:03:36Z","snapshot_observed_at":"2026-08-16T13:35:12.394513Z","submitted_at":"2024-07-11T06:50:19Z","title":"Speculative RAG: Enhancing Retrieval Augmented Generation through Drafting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08223","snapshot_observed_at":"2026-08-16T04:40:04.709408Z","title":"Speculative rag: Enhancing retrieval augmented generation through drafting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.709408Z"},"links":{"cited_paper":"/paper/2407.08223","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:d93ad1790b65f00313d537554d930d865b3bd40a93e17ef89231b3c448c1bda1","observation_id":"fef123b6-cd79-4b57-9140-01a1cfeb7e20","resolution":{"observed_at":"2026-08-16T04:40:04.709408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.714961Z","title":"Chain-of-thought prompt- ing elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.714961Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:5d888baf52101ef91c88ce51aff1b874a9c8e251cc86bc794b9db098fa77a718","observation_id":"b24e9d14-8ae8-4b3d-9a6d-dcb1e882d17e","resolution":{"observed_at":"2026-08-16T04:40:04.714961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.881587Z","title":"https://www.octomind.dev/blog/why-we-no-longer-use-langchain- for-building-our-ai-agents","venue":null,"work_id":"e2186281-47e4-4e07-954c-1d27d0899ceb","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.720494Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:0b962bd286bdd063aa724edf87c86d1b81a6e8d2f6a1ee15c006b72ef332652c","observation_id":"b6b493bd-43a4-4b37-a10d-b931e883f563","resolution":{"observed_at":"2026-08-16T04:40:05.887797Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04187","last_updated":"2024-10-15T17:37:42Z","snapshot_observed_at":"2026-08-16T13:27:48.500497Z","submitted_at":"2024-08-08T03:11:12Z","title":"Medical Graph RAG: Towards Safe Medical Large Language Model via Graph Retrieval-Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04187","snapshot_observed_at":"2026-08-16T04:40:04.725922Z","title":"Medical graph rag: Towards safe medical large language model via graph retrieval-augmented generation.arXiv preprint arXiv:2408.04187, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.725922Z"},"links":{"cited_paper":"/paper/2408.04187","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:f781f7f8b77c9ce81da050a197c9220667777bf14cbe2a48a2d51a96e319b1d2","observation_id":"4f593372-3444-45af-9ecf-0cd66f95130f","resolution":{"observed_at":"2026-08-16T04:40:04.725922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.864091Z","title":"Irina: Accelerating dnn inference with efficient online scheduling","venue":null,"work_id":"73a1f45a-ba2a-4473-91eb-640f629b717d","year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.730918Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:a00c3e2f4a2002fd8d431cbd094d0c861897284d0e75ae03253fc3c108adf459","observation_id":"a7069e26-3cc5-4821-9209-fac8701df47c","resolution":{"observed_at":"2026-08-16T04:40:05.870745Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.832055Z","title":"Tkg-rag: A retrieval-augmented generation framework with text-chunk knowl- edge graph","venue":null,"work_id":"395ffbba-9235-447f-ae71-7ba9f1bfadbc","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.741077Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:c02ac43c5e82c46900840eb600189da1744df90c1a539e75d61d4bba126838c9","observation_id":"6f07dd24-355b-41cc-a205-72e32949675d","resolution":{"observed_at":"2026-08-16T04:40:05.838382Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.812571Z","title":"Corrective retrieval augmented generation","venue":null,"work_id":"9b648fc2-9bbe-4100-9ca3-dde993c5ab74","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.746532Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:4384879184496607105891d0552017ec9cc265850dd16ccd4ec4bd251e8787d3","observation_id":"86a5eb53-5083-456e-8345-e9e0d5ab926c","resolution":{"observed_at":"2026-08-16T04:40:05.819297Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.792999Z","title":"Wikiqa: A challenge dataset for open-domain question answering","venue":null,"work_id":"3f1dccf4-c8f2-4242-96ca-bd36abed424a","year":2015},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.752628Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:8d4e76042c17902191ce00a5766a6957b8a8818234148524abeaf2b66fe7a19d","observation_id":"3d4d4ae7-0004-48d6-bd42-dc9f9453d793","resolution":{"observed_at":"2026-08-16T04:40:05.798597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.758024Z","title":"Orca: A distributed serving system for {Transformer-Based} generative models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.758024Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:23eecd6a0991aa4e7125222018ab82a92f90b145e8761ea39d5640ca7d17dd07","observation_id":"9d037070-347f-4c0e-8371-c9ed2de37c99","resolution":{"observed_at":"2026-08-16T04:40:04.758024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.762161Z","title":"Spark: Cluster computing with working sets","venue":null,"work_id":"398a2706-f860-423c-ad9d-5ae769357b9a","year":2010},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.764118Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:037e4538385336dcc0e8c693c4747c29a6ddff5580f2d8bafa72e65fceb19116","observation_id":"13b691b4-b7fe-433a-a9ec-78322086479e","resolution":{"observed_at":"2026-08-16T04:40:05.767757Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.769148Z","title":"SHEP- HERD: Serving DNNs in the wild","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.769148Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:c06ce5c1a9ab0a901c8223c42fee8abbd0d197c0e2565297b7b439f708bbf090","observation_id":"be04f45a-85c2-466b-9016-0530ae977b42","resolution":{"observed_at":"2026-08-16T04:40:04.769148Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:05.733551Z","title":"Raft: Adapting language model to domain specific rag","venue":null,"work_id":"848697fe-74d6-478a-a61f-47777b0004d4","year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.773687Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:07b251d22e16ff7fa6937644188634d7d095b3fb4fa54b4cca9b2af2b37b2143","observation_id":"95211b6e-e774-48d8-950a-45cf07a5c0b0","resolution":{"observed_at":"2026-08-16T04:40:05.738737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-16T06:30:59.297886+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14021","last_updated":"2024-01-25T09:06:44Z","snapshot_observed_at":"2026-08-16T14:24:38.678837Z","submitted_at":"2024-01-25T09:06:44Z","title":"Accelerating Retrieval-Augmented Language Model Serving with Speculation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14021","snapshot_observed_at":"2026-08-16T04:40:04.778794Z","title":"Accelerating retrieval-augmented language model serving with speculation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.778794Z"},"links":{"cited_paper":"/paper/2401.14021","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:75e417c7e32fba8d3d70be18267c2c935d064b933c618031bfbfa1663a58ef79","observation_id":"3eb1b92f-2684-4ab2-b336-74e35daf7844","resolution":{"observed_at":"2026-08-16T04:40:04.778794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.783073Z","title":"P Xing, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.783073Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:67bb9cc6331c770e80496159fd2c430d574846d622ad655d5970aa432a51dc9c","observation_id":"f00736cd-e37e-4693-ab4d-b4ac076adb03","resolution":{"observed_at":"2026-08-16T04:40:04.783073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1709.00103","last_updated":"2017-11-09T23:06:14Z","snapshot_observed_at":"2026-08-16T12:20:26.377960Z","submitted_at":"2017-08-31T23:12:15Z","title":"Seq2SQL: Generating Structured Queries from Natural Language using Reinforcement Learning","version":7},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1709.00103","snapshot_observed_at":"2026-08-16T04:40:04.787699Z","title":"Seq2sql: Generating structured queries from natural language using reinforcement learning","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.787699Z"},"links":{"cited_paper":"/paper/1709.00103","citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:efaeef6cd49d8addd65cf3727487232fcd5871563c6a1ac3a54adf3c72b1022e","observation_id":"bbb470d0-071a-476c-8b8f-3ca5ca5439a8","resolution":{"observed_at":"2026-08-16T04:40:04.787699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.736089Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.736089Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:6551d1cda854d37874be95871b18fe1ab32c18c7840f34b295027a3bfe069daf","observation_id":"56f05b62-1e93-404a-9887-ca55bb14af4c","resolution":{"observed_at":"2026-08-16T04:40:04.736089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T04:40:04.452536Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-16T04:40:04.452536Z"},"links":{"citing_paper":"/paper/2505.07833"},"observation_digest":"sha256:7d030356d60bc113c917595fc5bf0bf88fa87b9ce44dc847921f9f66aa4ed067","observation_id":"5dd7fb93-433b-4543-aa06-51771e9919f2","resolution":{"observed_at":"2026-08-16T04:40:04.452536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.07833","last_updated":"2026-06-04T21:46:57Z","latest_version":2,"primary_category":"cs.DC","snapshot_observed_at":"2026-08-16T15:00:54.076963Z","submitted_at":"2025-05-01T18:58:26Z","title":"Harmonia: End-to-End RAG Serving Optimization"},"reference_resolution":{"displayed":89,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":31},"total_outbound_references":89},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-16T06:30:59.297886+00:00","source":"crossref"},{"observed_at":"2026-08-16T06:30:54.164669+00:00","source":"retraction_watch"}],"thesis":"As of 16 August 2026, this Paper Citation Record lists 89 of 89 outbound references and 0 inbound Pith citation observations for arXiv:2505.07833."}