{"as_of":"2026-08-11T11:03:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:ddc85066bdcf03022586c9f1e6456e6f49d0b3a35d0d60e880070a5b187717b8","coverage":[{"denominator":42,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":42,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T06:46:26.478418Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T13:52:28.587806Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.22025","snapshot_observed_at":"2026-08-01T13:52:28.587806Z","title":"When generic prompt improvements hurt: Evaluation-driven iteration for LLM applications","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.18975","last_updated":"2026-07-21T11:10:38Z","snapshot_observed_at":"2026-08-08T02:10:57.034054Z","submitted_at":"2026-07-21T11:10:38Z","title":"Mi-Memory: A Lifecycle Memory Framework for Personal AI","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T13:52:28.587806Z"},"links":{"cited_paper":"/paper/2601.22025","citing_paper":"/paper/2607.18975"},"observation_digest":"sha256:57393912176cace9e4fb20d0aab88ef9885e5f9ca4d4c92b5aef34f1dc8a567b","observation_id":"56e0dc3f-31bb-4b50-9c3b-b8108b784197","resolution":{"observed_at":"2026-08-01T13:52:28.587806Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2601.22025/citation-record","integrity":"/paper/2601.22025/integrity","json":"/paper/2601.22025/citation-record.json","paper":"/paper/2601.22025"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-03T06:46:26.181481Z","title":"Constitu- tional ai: Harmlessness from ai feedback.arXiv preprint arXiv:2212.08073, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.181481Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:29291d9150125a9b54aac9d5a4721497cde8668d2cb57a4f04c903c094599d3c","observation_id":"0d4274b2-69b1-4e55-912c-3f70d875307e","resolution":{"observed_at":"2026-08-03T06:46:26.181481Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.15217","last_updated":"2025-04-28T05:09:12Z","snapshot_observed_at":"2026-08-05T02:02:34.574070Z","submitted_at":"2023-09-26T19:23:54Z","title":"Ragas: Automated Evaluation of Retrieval Augmented Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.15217","snapshot_observed_at":"2026-08-03T06:46:26.193439Z","title":"Ragas: Automated evaluation of retrieval augmented generation.arXiv preprint arXiv:2309.15217, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.193439Z"},"links":{"cited_paper":"/paper/2309.15217","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:137965a48da5aaa0381c732269800e7b084fb1e08d804aa8ced22cfcabccceeb","observation_id":"6fec83e7-30de-4b38-b3b0-dcd8c80cd51f","resolution":{"observed_at":"2026-08-03T06:46:26.193439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.07858","last_updated":"2022-11-22T19:12:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-23T23:37:14Z","title":"Red Teaming Language Models to Reduce Harms: Methods, Scaling Behaviors, and Lessons Learned","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.07858","snapshot_observed_at":"2026-08-03T06:46:26.200818Z","title":"Red teaming language models to reduce harms: Methods, scaling behaviors, and lessons learned.arXiv preprint arXiv:2209.07858, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.200818Z"},"links":{"cited_paper":"/paper/2209.07858","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:d824dab905848029b13b81b241db3f8843d2a515cfe35314eebc344e428ce148","observation_id":"1d7edf6f-ede9-48e4-a462-222bdd539e28","resolution":{"observed_at":"2026-08-03T06:46:26.200818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.207610Z","title":"Language model evaluation harness.https://github.com/EleutherAI/lm-evaluation-harness, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.207610Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:ca1d440bb1eaa68913702c4677bea0ee4ba8f2c1d1d0e7a78b66fb9a54199105","observation_id":"7d21660b-26a8-4905-baf1-ca082d8d8a86","resolution":{"observed_at":"2026-08-03T06:46:26.207610Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.212907Z","title":"On calibration of modern neural networks.International Conference on Machine Learning, pages 1321–1330, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.212907Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:55738adab26bae09a96889de1b558378b9dbd9d66a2cdab0a2408143a0f307bc","observation_id":"fa6ab860-6b49-4130-b8ec-0d2b137789e0","resolution":{"observed_at":"2026-08-03T06:46:26.212907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-10T12:35:09.020030Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-03T06:46:26.218264Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.218264Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:c1db0edbf78bd55af23939fd4ad0a24c5ec8ac0d74794dc1b4e3085e600f0a55","observation_id":"d7fb54a3-5fe5-485c-b28a-39c729601e6e","resolution":{"observed_at":"2026-08-03T06:46:26.218264Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.10160","last_updated":"2023-10-18T13:17:13Z","snapshot_observed_at":"2026-08-10T20:00:16.124003Z","submitted_at":"2023-05-17T12:23:38Z","title":"Stop Uploading Test Data in Plain Text: Practical Strategies for Mitigating Data Contamination by Evaluation Benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.10160","snapshot_observed_at":"2026-08-03T06:46:26.230145Z","title":"Stop uploading test data in plain text: Practical strategies for mitigating data contamination by evaluation benchmarks.arXiv preprint arXiv:2305.10160, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.230145Z"},"links":{"cited_paper":"/paper/2305.10160","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:8a21676ab6267bb03ef15cb200339225942df20f839e2a0b215e733ce0c2bbf6","observation_id":"1b7beccb-dbfb-4fc2-913d-02deb0567a92","resolution":{"observed_at":"2026-08-03T06:46:26.230145Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.236101Z","title":"Survey of hallucination in natural language generation.ACM Computing Surveys, 55(12):1–38, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.236101Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:4a9d5435482cfdbe077fb1e120ed7896e536f647db119de1383cf0751f66897e","observation_id":"b5619446-54b0-4b95-b434-b9a6fe6be5bd","resolution":{"observed_at":"2026-08-03T06:46:26.236101Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-03T06:46:26.243906Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.243906Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:f3b717a6642dc1df556132987692c394074aa8e0be55c52bb0885a019f55c3b1","observation_id":"e2f44361-f2f2-46ae-a306-e09af85d1fd0","resolution":{"observed_at":"2026-08-03T06:46:26.243906Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.252662Z","title":"Computing krippendorff’s alpha-reliability.Departmental Papers (ASC), 2011","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.252662Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:7aba0b992b6b1a2f812960b7efeb2f48d3773fbc9083485fc6a592eeb6f4c544","observation_id":"ec87f45a-0667-481b-ab1a-6f8785d22127","resolution":{"observed_at":"2026-08-03T06:46:26.252662Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.259826Z","title":"Retrieval- augmented generation for knowledge-intensive nlp tasks.Advances in Neural Information Processing Systems, 33:9459–9474, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.259826Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:f8687cc7e52068e2a29a88210b6245255aa75438caecc4f97234254fcb063237","observation_id":"dede9957-29c3-4500-81c8-dbb3fa3cf791","resolution":{"observed_at":"2026-08-03T06:46:26.259826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.268546Z","title":"Holistic evaluation of language models.Transactions on Machine Learning Research, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.268546Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:2d0a033d7e0a5cd9a62aca6fa14113a5155456ee5f648206a83ab4079c5f37f3","observation_id":"48a12c09-5ca5-4925-8609-f68c7a6a6754","resolution":{"observed_at":"2026-08-03T06:46:26.268546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.278646Z","title":"Rouge: A package for automatic evaluation of summaries.Text Summa- rization Branches Out, pages 74–81, 2004","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.278646Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:6d2de1b09fa4f59eae517392483601b48476cb95137d8845038f31dd0d8285de","observation_id":"937a9e9b-e375-45a1-a24e-186803836d2c","resolution":{"observed_at":"2026-08-03T06:46:26.278646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07958","last_updated":"2022-05-08T02:43:02Z","snapshot_observed_at":"2026-08-03T16:26:48.747700Z","submitted_at":"2021-09-08T17:15:27Z","title":"TruthfulQA: Measuring How Models Mimic Human Falsehoods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.07958","snapshot_observed_at":"2026-08-03T06:46:26.284150Z","title":"Truthfulqa: Measuring how models mimic human falsehoods.arXiv preprint arXiv:2109.07958, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.284150Z"},"links":{"cited_paper":"/paper/2109.07958","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:2efe31128dfc3ea83f21dae574411479c4d0f5afe363858b28199d403bbe6978","observation_id":"9c635d45-dfee-4172-8dd1-b51b48722f11","resolution":{"observed_at":"2026-08-03T06:46:26.284150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.00661","last_updated":"2020-05-02T00:09:16Z","snapshot_observed_at":"2026-08-10T04:33:38.804864Z","submitted_at":"2020-05-02T00:09:16Z","title":"On Faithfulness and Factuality in Abstractive Summarization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.00661","snapshot_observed_at":"2026-08-03T06:46:26.291385Z","title":"On faithfulness and factuality in abstractive summarization.arXiv preprint arXiv:2005.00661, 2020","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.291385Z"},"links":{"cited_paper":"/paper/2005.00661","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:a2379425a5a3047b4ed9a5ea0b1450e19099e70806c0a9bf6c7c2a6a9d5b85b5","observation_id":"b580fb96-f051-4051-9703-84073ec4ce2d","resolution":{"observed_at":"2026-08-03T06:46:26.291385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14251","last_updated":"2023-10-11T05:27:50Z","snapshot_observed_at":"2026-08-01T16:29:58.693560Z","submitted_at":"2023-05-23T17:06:00Z","title":"FActScore: Fine-grained Atomic Evaluation of Factual Precision in Long Form Text Generation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14251","snapshot_observed_at":"2026-08-03T06:46:26.296715Z","title":"Factscore: Fine-grained atomic evalu- ation of factual precision in long form text generation.arXiv preprint arXiv:2305.14251, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.296715Z"},"links":{"cited_paper":"/paper/2305.14251","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:d654b686e4733d4af91e61323bdb8484e35dd9a12dd9ef5c4a20b7c99e1e63bc","observation_id":"bf6067e1-4326-4f96-939f-5a8c9c8cc09c","resolution":{"observed_at":"2026-08-03T06:46:26.296715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.305008Z","title":"Openai evals.https://github.com/openai/evals, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.305008Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:00695dfafb91f467253ac52069c39ba130c2f4c67c28464a35afe8713062b0ba","observation_id":"0fa099e0-a7b9-496c-b7ab-4e2fad7d3189","resolution":{"observed_at":"2026-08-03T06:46:26.305008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.313308Z","title":"Training language mod- els to follow instructions with human feedback.Advances in Neural Information Processing Systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.313308Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:6f2b775b3fd17ed27a741736e871ef8b67e5f3ebf85593df43fce5c9dadfa99a","observation_id":"cff1e5be-7173-4e4b-bd59-7f86a4ad03dd","resolution":{"observed_at":"2026-08-03T06:46:26.313308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.13076","last_updated":"2024-04-15T16:49:59Z","snapshot_observed_at":"2026-08-11T08:26:18.478575Z","submitted_at":"2024-04-15T16:49:59Z","title":"LLM Evaluators Recognize and Favor Their Own Generations","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.13076","snapshot_observed_at":"2026-08-03T06:46:26.318507Z","title":"Llm evaluators recognize and favor their own generations.arXiv preprint arXiv:2404.13076, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.318507Z"},"links":{"cited_paper":"/paper/2404.13076","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:c60ae6e3ad4b53bbfc7e18803e4cd9a9b51da9777118a4313598112bfe687a93","observation_id":"e05ec9cd-5555-4d59-9cce-b93d2cab1d80","resolution":{"observed_at":"2026-08-03T06:46:26.318507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.03286","last_updated":"2022-02-07T15:22:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-02-07T15:22:17Z","title":"Red Teaming Language Models with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.03286","snapshot_observed_at":"2026-08-03T06:46:26.324859Z","title":"Red teaming language models with language models.arXiv preprint arXiv:2202.03286, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.324859Z"},"links":{"cited_paper":"/paper/2202.03286","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:14c70de097b6294fcb346b3124d94fc1912dc704c581fc171a80f99dc8dd6382","observation_id":"4d0f27fb-637b-4b23-b91b-06d707a3b1a9","resolution":{"observed_at":"2026-08-03T06:46:26.324859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09476","last_updated":"2024-03-31T20:58:46Z","snapshot_observed_at":"2026-08-10T20:00:18.749793Z","submitted_at":"2023-11-16T00:39:39Z","title":"ARES: An Automated Evaluation Framework for Retrieval-Augmented Generation Systems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09476","snapshot_observed_at":"2026-08-03T06:46:26.331261Z","title":"Ares: An auto- mated evaluation framework for retrieval-augmented generation systems.arXiv preprint arXiv:2311.09476, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.331261Z"},"links":{"cited_paper":"/paper/2311.09476","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:64764f3fa1cdad72ab01e6dababf0e34f143fcada767d9ca4ee2df8c27cf398d","observation_id":"0377750d-6f53-440b-9e31-f8b4592ec00d","resolution":{"observed_at":"2026-08-03T06:46:26.331261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18018","last_updated":"2023-10-27T09:48:29Z","snapshot_observed_at":"2026-08-10T20:00:19.698973Z","submitted_at":"2023-10-27T09:48:29Z","title":"NLP Evaluation in trouble: On the Need to Measure LLM Data Contamination for each Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18018","snapshot_observed_at":"2026-08-03T06:46:26.337035Z","title":"Nlp evaluation in trouble: On the need to measure llm data contamination for each benchmark.arXiv preprint arXiv:2310.18018, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.337035Z"},"links":{"cited_paper":"/paper/2310.18018","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:ee896227a6f1872da511b56bbf327daaa2562f83be66de9abd893147db497650","observation_id":"d6048266-81af-4ed5-9c79-d42da57ac594","resolution":{"observed_at":"2026-08-03T06:46:26.337035Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.04696","last_updated":"2020-05-21T16:53:47Z","snapshot_observed_at":"2026-08-10T19:14:01.245716Z","submitted_at":"2020-04-09T17:26:52Z","title":"BLEURT: Learning Robust Metrics for Text Generation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.04696","snapshot_observed_at":"2026-08-03T06:46:26.342276Z","title":"Bleurt: Learning robust metrics for text generation.arXiv preprint arXiv:2004.04696, 2020","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.342276Z"},"links":{"cited_paper":"/paper/2004.04696","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:c01de76804d2173612d9687b87475904d25d242615b6c06ed4d65b25b28a0879","observation_id":"c8b1f316-d9e5-45ad-af54-0cc5541e8488","resolution":{"observed_at":"2026-08-03T06:46:26.342276Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-03T06:46:26.348309Z","title":"Beyond the imitation game: Quantifying and extrapolating the capabilities of language models.arXiv preprint arXiv:2206.04615, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.348309Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:6182fc7ef12a6df5f341a763f3b8f94b77963d2bb62a65a0326f6519639e0c72","observation_id":"52b1f8f9-cd37-4b3d-9806-07d0c9eaf17f","resolution":{"observed_at":"2026-08-03T06:46:26.348309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-03T06:46:26.353366Z","title":"Large language models are not fair evaluators.arXiv preprint arXiv:2305.17926, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.353366Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:882c21f030befc6d3431ca9d4427b84ddd3a979c3a382e3065274c1e37b0ca9d","observation_id":"554301a6-be59-4a82-9304-0c40a860e416","resolution":{"observed_at":"2026-08-03T06:46:26.353366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-03T06:46:26.361211Z","title":"Bertscore: Evaluating text generation with bert.arXiv preprint arXiv:1904.09675, 2020","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.361211Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:843276a5e5adbd7125021feb00c9a4159985f92da0fda3bc3772c6f7e0731c31","observation_id":"3967a47a-f691-4b57-b57c-860e8a86fd68","resolution":{"observed_at":"2026-08-03T06:46:26.361211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-03T06:46:26.366420Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.arXiv preprint arXiv:2306.05685, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.366420Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:6e377e12a6f594eaab8f69a3bd8c95399af91a868084ac732a3f04bf41b744f1","observation_id":"e028793b-e67c-49a0-aeb8-c55dc563c994","resolution":{"observed_at":"2026-08-03T06:46:26.366420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-10T20:00:17.646392Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-03T06:46:26.373904Z","title":"Promptbench: Towards eval- uating the robustness of large language models on adversarial prompts.arXiv preprint arXiv:2306.04528, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.373904Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:c39e882135ce5e07e13b845f8b9386366329cb226963d98c125462a453158932","observation_id":"0495afe7-d37d-4a4b-8fe3-b7e7c29526c7","resolution":{"observed_at":"2026-08-03T06:46:26.373904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.379891Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.379891Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:116e6cfaa7ee8efd236fbe24b71f6a8306cc6baccbf126bba700eb3dbd65eb20","observation_id":"f69b204c-5028-4705-99bf-df87c86cbc5f","resolution":{"observed_at":"2026-08-03T06:46:26.379891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.391383Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.391383Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:dc372733c83f3dafd85694038bb84fb90e9a7c49136ba4f82f29665f09d35ef1","observation_id":"d1ecf084-a41d-4aef-9793-e71613aa2689","resolution":{"observed_at":"2026-08-03T06:46:26.391383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.402681Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.402681Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:afb86cef2a6c705035a8466d7c4a4c1f63d957701cbe59818fc9927748e8d616","observation_id":"81b93a26-7363-47dd-b7a3-179827c81889","resolution":{"observed_at":"2026-08-03T06:46:26.402681Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.410237Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.410237Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:fe2fbc6fc7b7262f6a027ba8b6458c8803b67fc03096ce61beca2d5e67c51d56","observation_id":"dedd61d1-4cff-465a-a81b-48a554abcda8","resolution":{"observed_at":"2026-08-03T06:46:26.410237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.418141Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.418141Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:989aeb95018fc48539c8b7ac85daf2179a1d8fcaf4e8696bdca2151c1a2f5298","observation_id":"333ea756-0285-427a-86d2-16c488817dd4","resolution":{"observed_at":"2026-08-03T06:46:26.418141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.425217Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.425217Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:d23cb675ab5e89c01e20c3a362a7a91c786b8423a659f05c42cf9c6c6123ecd5","observation_id":"ad4d3492-84ed-4b7e-84c5-1e7563b2f7f0","resolution":{"observed_at":"2026-08-03T06:46:26.425217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.435130Z","title":"38 A.5 LLM-as-Judge Checklist","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.435130Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:9b246fb526d2fc65909ce9879eb690db46464aa239459284c3d57ff1ad630478","observation_id":"221e6b5e-ca51-41ce-8a36-f075d138d4e1","resolution":{"observed_at":"2026-08-03T06:46:26.435130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.444650Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.444650Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:845dc3574e4e49b4a3b3fec57bf7bf5ff6879ecab3167d93d7b9e0eea297370b","observation_id":"23232521-b3c1-489a-9270-047535cf5155","resolution":{"observed_at":"2026-08-03T06:46:26.444650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.451123Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.451123Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:14249fdd39a6a26daf19813cee4bb28238ad0c23fc74c45675c0576d92d59a7d","observation_id":"52f2671f-e169-4b06-9c3a-df1a8b0b211a","resolution":{"observed_at":"2026-08-03T06:46:26.451123Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.456928Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.456928Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:a566f6c417b45cfde985a929f35c7361a8da1cde5d0b5ad7932d8cea1352b32e","observation_id":"27e39043-40f1-4236-acc4-0665905b6fe1","resolution":{"observed_at":"2026-08-03T06:46:26.456928Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.463034Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.463034Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:4906bd3b520e75d0733bea350df01ffcce75e4430986cdac20620c65809bb634","observation_id":"585f1f71-b53e-4979-a2b2-ebd1bc7f65a5","resolution":{"observed_at":"2026-08-03T06:46:26.463034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.467732Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.467732Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:283760eecb014af442459e5888cfdf61b92074c7e481809d7556dac320ef4236","observation_id":"38f0d459-79b2-49dc-badf-5834603dbe0a","resolution":{"observed_at":"2026-08-03T06:46:26.467732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.472653Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.472653Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:567e13f64a74eff424406ebfc7515786c09bd074918f3ee6baaadbfdebadd57f","observation_id":"c9b374fc-ed31-415c-83aa-0682f972ba28","resolution":{"observed_at":"2026-08-03T06:46:26.472653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T06:46:26.478418Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-03T06:46:26.478418Z"},"links":{"citing_paper":"/paper/2601.22025"},"observation_digest":"sha256:a66cab92aaaa024c112d5aa6ec8f838880df3e53e11daa140e01f54f9d63df32","observation_id":"25d8ffb2-91e7-4a5b-81c7-56d5f0af33a3","resolution":{"observed_at":"2026-08-03T06:46:26.478418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2601.22025","last_updated":"2026-06-09T23:57:32Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T21:40:38.906811Z","submitted_at":"2026-01-29T17:32:34Z","title":"When Generic Prompt Improvements Hurt: Evaluation-Driven Iteration for LLM Applications"},"reference_resolution":{"displayed":42,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":42,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":42},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 42 of 42 outbound references and 1 inbound Pith citation observation for arXiv:2601.22025."}