{"as_of":"2026-08-09T07:43:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d3a3472c1a6856603607d6239b321c6225acc5e66ea854a7830d0b0f6d014717","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T16:55:45.557734Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-20T13:40:04.275438Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-20T13:43:19.601845Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.06065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking prompt sensitivity in large language models","venue":null,"work_id":"a924e032-6aaf-466b-bb4a-d266431cec04","year":2025},"citing_paper":{"arxiv_id":"2604.19260","last_updated":"2026-04-21T09:21:14Z","snapshot_observed_at":"2026-07-31T22:25:13.931512Z","submitted_at":"2026-04-21T09:21:14Z","title":"Understanding the Mechanism of Altruism in Large Language Models","version":1},"reference_index":192,"source":"arxiv_source","source_observed_at":"2026-05-10T01:36:50.329664Z"},"links":{"cited_paper":"/paper/2502.06065","citing_paper":"/paper/2604.19260"},"observation_digest":"sha256:555877bf59036722b9ac3bfb70803d495afa20aacb6d423ebf910b3da0bc97ea","observation_id":"7e8f3c14-1ffe-43e3-98ed-a7d2cb6e2295","resolution":{"observed_at":"2026-05-11T13:31:02.511069Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.06065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking prompt sensitivity in large language models","venue":null,"work_id":"a924e032-6aaf-466b-bb4a-d266431cec04","year":2025},"citing_paper":{"arxiv_id":"2605.08522","last_updated":"2026-05-14T09:18:49Z","snapshot_observed_at":"2026-07-06T23:20:43.010758Z","submitted_at":"2026-05-08T22:05:19Z","title":"Coordinates of Capability: A Unified MTMM-Geometric Framework for LLM Evaluation","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-12T01:41:42.003483Z"},"links":{"cited_paper":"/paper/2502.06065","citing_paper":"/paper/2605.08522"},"observation_digest":"sha256:6d4fd0cb95e15a85eeb9c1176b01f12dd8ac9b4dbed1dbd55115f9d09838213e","observation_id":"ac8129f6-3efa-4cfa-9687-e94cbfea7a27","resolution":{"observed_at":"2026-05-12T01:46:14.436745Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"cited_work":{"arxiv_id":"2502.06065","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.06065","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Benchmarking prompt sensitivity in large language models","venue":null,"work_id":"a924e032-6aaf-466b-bb4a-d266431cec04","year":2025},"citing_paper":{"arxiv_id":"2605.18890","last_updated":"2026-05-17T00:21:53Z","snapshot_observed_at":"2026-08-04T03:29:34.208507Z","submitted_at":"2026-05-17T00:21:53Z","title":"Stop Drawing Scientific Claims from LLM Social Simulations Without Robustness Audits","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-20T13:40:04.275438Z"},"links":{"cited_paper":"/paper/2502.06065","citing_paper":"/paper/2605.18890"},"observation_digest":"sha256:daae4a40ceda2884d8b720e2c8e5b68d764bc6f729c629467c6532da6c124cc1","observation_id":"9eacf9cf-1ef4-420b-bfd1-49665c342223","resolution":{"observed_at":"2026-05-20T13:43:19.603517Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.06065/citation-record","integrity":"/paper/2502.06065/integrity","json":"/paper/2502.06065/citation-record.json","paper":"/paper/2502.06065"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.260064Z","title":null,"venue":null,"work_id":"9949f8f5-f75c-4ba4-9292-3eaf4642f238","year":2021},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.426645Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:7c46588e48e1c1a0c6f66c5bb27c518d56de267ee886a527e2bc3eab54bcda86","observation_id":"c7831059-049e-483c-b6a7-5ae62f7a32e5","resolution":{"observed_at":"2026-08-08T16:55:46.262863Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.251841Z","title":null,"venue":null,"work_id":"2c7e82d8-ecf7-4bff-a6f5-f7ab5f6890ca","year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.430337Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:cbd5a003791b0093ec473983ed83e6c742cce10c2453b20dc4d9700578669bf1","observation_id":"f0db9cb2-d921-4d21-9879-cb757f49591f","resolution":{"observed_at":"2026-08-08T16:55:46.254795Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.433342Z","title":"In: Al- Onaizan,Y.,Bansal,M.,Chen,Y.N.(eds.)Proceedingsofthe2024ConferenceonEmpirical Methods in Natural Language Processing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.433342Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:511446ca99c5ff6fc81b959152eb12dc5ea78f0fdf62782548beee8b6e978148","observation_id":"5be17900-1104-40a4-9899-7b9681e98a42","resolution":{"observed_at":"2026-08-08T16:55:45.433342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.243832Z","title":"In: European Conference on Information Retrieval","venue":null,"work_id":"9e432142-8087-4044-bf66-37bc759d9795","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.436845Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:64ff7034eb729d18be0b8a34694d150c6431621114971ec59e2a8827e321c770","observation_id":"2eea4f62-aa24-40e7-8473-e1da6528e81f","resolution":{"observed_at":"2026-08-08T16:55:46.246742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.235659Z","title":"In: Proceedings of the 2024 AnnualInternationalACMSIGIRConferenceonResearchandDevelopmentinInformation Retrieval in the Asia Pacific Region","venue":null,"work_id":"e6a338aa-2bd6-45ea-badc-dcb5bc279c7b","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.440027Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:04e0759b5313f684ddce8254b5f415c1cfa6bed3c11b375dc108fff822507c5d","observation_id":"dfc17dfd-c25a-4437-8f36-400d00802611","resolution":{"observed_at":"2026-08-08T16:55:46.238705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.227454Z","title":"In: Proceedings of the 31st ACM International Conference on Information & Knowledge Management","venue":null,"work_id":"f45a202d-58a2-497b-99b6-3ffcaa8ea8fa","year":2022},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.443134Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:e25916c70915b7462898863586bd5be866f6258dad08b1f862d52391efea7aaf","observation_id":"afea40b4-363b-46dc-9477-8eb6156e6d6b","resolution":{"observed_at":"2026-08-08T16:55:46.230432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.219263Z","title":null,"venue":null,"work_id":"c42aa3fc-df7d-4ceb-bee5-74ad12cd21cf","year":2020},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.446388Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:bd56ba2937cdecfe52ef59b47b38f963cabdb304630cf0c5762c31532e244d33","observation_id":"7540a4d6-a0e8-4039-9ebf-3ebec2efc0df","resolution":{"observed_at":"2026-08-08T16:55:46.222231Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-45442-5_10","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.691573Z","title":null,"venue":null,"work_id":"017de053-8fba-428d-ba06-0c78f6c8d9f9","year":2020},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.449259Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:e499aad82c28e1e139a27de8b6b69637aa0c6fafc6f30d0556d5f0f55e9eccd9","observation_id":"ba1d22d8-203c-426b-a3f1-4a7e7bc106a8","resolution":{"observed_at":"2026-08-08T16:55:45.695016Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.452428Z","title":"In: Proceedings of the 28th ACM International Conference on Information and Knowledge Management","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.452428Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:8f37202c8feadeefd9a51f719f2809a41afd02a02fa8a827b617f9513d25016c","observation_id":"ca08d4bd-05fa-42ca-88c8-50f68234115a","resolution":{"observed_at":"2026-08-08T16:55:45.452428Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.04444","last_updated":"2024-07-03T22:23:50Z","snapshot_observed_at":"2026-08-07T16:22:47.800080Z","submitted_at":"2023-10-02T22:35:40Z","title":"What's the Magic Word? A Control Theory of LLM Prompting","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.04444","snapshot_observed_at":"2026-08-08T16:55:45.455564Z","title":"ArXivabs/2310.04444 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.455564Z"},"links":{"cited_paper":"/paper/2310.04444","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:25b44b05cc4af1434f844f95c485a7c8601ef4265d3394d9a96fabf44ed4ea70","observation_id":"5104d4e0-1104-4669-b20e-731c025fe304","resolution":{"observed_at":"2026-08-08T16:55:45.455564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.211037Z","title":"In: European Conference on Information Retrieval","venue":null,"work_id":"c4f4edee-c934-4eaf-9d20-71c86586c70b","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.459104Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:155b85fd1bf4ec6b548d17764e7cec7e068e5b2c89a8f731e8d603e0907cb411","observation_id":"abc38505-6812-43a0-a97b-1d0c66d75fdb","resolution":{"observed_at":"2026-08-08T16:55:46.213922Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-642-12275-0_15","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.670727Z","title":null,"venue":null,"work_id":"6bce8b81-7a60-41aa-8bc7-828ef5733924","year":2010},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.464402Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:7f26edce0ebad30e6356900674224068bbbff260aa850337fdadedbce3a82875","observation_id":"522b75aa-f2cc-49d0-92e0-c56cc7f0eea2","resolution":{"observed_at":"2026-08-08T16:55:45.674197Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.202750Z","title":"In: European Conference on Information Retrieval","venue":null,"work_id":"f2698de7-8f6d-4c85-bece-b1a7892b6efa","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.467411Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:1c4b3806eaaeec01d0ebdb8b25352289f372e99567eab1342ca2943dcff591f7","observation_id":"73b7a0a9-616b-40b3-b352-2b02ab9cff01","resolution":{"observed_at":"2026-08-08T16:55:46.205708Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.470420Z","title":"In: Proceedings of the 46th International ACM SIGIR Conference on Research and Development in Informa- tion Retrieval","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.470420Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:8d6b172fda88311244a1172b8961a933e0499818af2bcc44e2df27cc9a375b7b","observation_id":"0737b338-7258-4e24-833d-e987613140a4","resolution":{"observed_at":"2026-08-08T16:55:45.470420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11891","last_updated":"2024-05-20T09:15:36Z","snapshot_observed_at":"2026-08-03T11:12:54.909828Z","submitted_at":"2024-05-20T09:15:36Z","title":"Unveiling and Manipulating Prompt Influence in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11891","snapshot_observed_at":"2026-08-08T16:55:45.473373Z","title":"ArXivabs/2405.11891(2024), https://api.semanticscholar","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.473373Z"},"links":{"cited_paper":"/paper/2405.11891","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:d243f1b138b1c1c0669839ed297c971805c66cbe8d2edc403bcaf531a67e9247","observation_id":"fb873f31-db0a-42d2-b04a-62f139adcc0c","resolution":{"observed_at":"2026-08-08T16:55:45.473373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.194678Z","title":"Information13(2), 83 (2022)","venue":null,"work_id":"e7594b7f-cd8a-49c8-9607-dd1c602325e5","year":2022},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.476636Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:3955dacd41be782eb0448c1d077d915a4fb06ea50eab9f982542df3cc8c5c315","observation_id":"47e15cfe-6d79-4e2d-ba23-a921e1f3f21b","resolution":{"observed_at":"2026-08-08T16:55:46.197515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.185878Z","title":"IEEE Access11, 76581–76604 (2023)","venue":null,"work_id":"0f8b53b2-6502-479b-aec7-b2fc91c06f86","year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.479575Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:805b4603056914b78329e9b555546ebcdea83233005ea38f02441f6658b17f63","observation_id":"fb4d5384-3382-4e8a-8f76-1a495dcddcc6","resolution":{"observed_at":"2026-08-08T16:55:46.189086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.177122Z","title":"In: CIKM (2008)","venue":null,"work_id":"b0be71e4-8615-4ffe-815b-96f54e4d4e7a","year":2008},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.482509Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:190adfddf4ac7cd78db693010fcb728f0167415d81f33cef91a632478a3f390f","observation_id":"ba3f28d9-862f-4301-8967-b5991ef90d38","resolution":{"observed_at":"2026-08-08T16:55:46.180181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.168443Z","title":"In: Proceedings of the 33rd ACM International Confer- ence on Information and Knowledge Management","venue":null,"work_id":"f64184df-019c-471a-8a0c-73b7fa6d9120","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.485697Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:5b420fb2922391b11df88eed87c6f37b6a2a55d8cab38b356a4c3a3186157257","observation_id":"e50f2947-2f99-4298-a5e9-46bda323f118","resolution":{"observed_at":"2026-08-08T16:55:46.171610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-08T16:55:45.488945Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.488945Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:dbcfa2722d2206d79f5630d7b678fa1f25a9df905070a501383d587e55f96a93","observation_id":"1108b83d-6dbb-42b0-8f06-b3c492a20636","resolution":{"observed_at":"2026-08-08T16:55:45.488945Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.492434Z","title":"In: Barzilay, R., Kan, M.Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.492434Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:032508a775d92924b1a6229ac6d75b0ba74754a6d5a304bd4b177a24996ea1da","observation_id":"26b35b12-ec95-466d-8789-17d125c14868","resolution":{"observed_at":"2026-08-08T16:55:45.492434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.495831Z","title":"In: Proceedings of the 61st Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.495831Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:201e413745c717853f898b8d26228f8b9d381125ee476a17b2bf67473a9cc8c9","observation_id":"5d2ef4fe-0748-4656-be65-2175709938e6","resolution":{"observed_at":"2026-08-08T16:55:45.495831Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-56063-7_27","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.647814Z","title":null,"venue":null,"work_id":"76ef85c3-d9fb-4257-9261-dfe975339d41","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.499110Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:18db0835597b500d8e5091db1b3bfbc7a574205b553bc81ddff3b07441ac4bc6","observation_id":"3b7ffde7-27fd-4fc6-b0bb-735a7538e3a7","resolution":{"observed_at":"2026-08-08T16:55:45.651096Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"5301.2023","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.975774Z","title":"Internet Reference Services Quarterly27, 203 – 210 (2023).https://doi.org/10.1080/ 10875301.2023.2227621","venue":null,"work_id":"9aefe83e-800d-4e25-8118-5953d48b5427","year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.502079Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:0afeaf1c73e34f686a56cafb1f801af2bd2d8ee856645a9f897b9a7a73e0d142","observation_id":"b729d661-c7d7-4087-9793-392ae8c4b0ea","resolution":{"observed_at":"2026-08-08T16:55:45.980823Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.505163Z","title":"https://doi.org/10.18653/v1/2023.findings-emnlp.241, http: //dx.doi.org/10.18653/v1/2023.findings-emnlp.241","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.505163Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:3807b6d923e91a19714eacf49f2e8ff4a8fdddd4f8b0c017710260acd5f0961b","observation_id":"7824525e-6804-474b-89bb-f2d8a9a39010","resolution":{"observed_at":"2026-08-08T16:55:45.505163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.508370Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.508370Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:e8493cba27df492520fd374d350d84fe39e6f0ce1b61cf62dd0c6aee2916295d","observation_id":"e257f84d-e8bb-43cd-9f61-7491da07ad2c","resolution":{"observed_at":"2026-08-08T16:55:45.508370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01012","last_updated":"2025-05-26T09:57:10Z","snapshot_observed_at":"2026-07-06T17:53:55.825572Z","submitted_at":"2024-04-01T09:33:05Z","title":"Query Performance Prediction using Relevance Judgments Generated by Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01012","snapshot_observed_at":"2026-08-08T16:55:45.511620Z","title":"arXiv preprint arXiv:2404.01012 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.511620Z"},"links":{"cited_paper":"/paper/2404.01012","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:f78c2c2cf34e90e2f323e0251af4e5164aa193fddef3cf207b5bc2df9f5afd0a","observation_id":"d4604f86-0b0a-4cca-890d-2db2442aa080","resolution":{"observed_at":"2026-08-08T16:55:45.511620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T16:55:45.514952Z","title":"arXiv preprint arXiv:2407.21783 (2024)","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.514952Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:1ccb5e4677bc3864de8fa722dbb1813c3cd235e60c6d6ac9245e07d2ab1db418","observation_id":"93cfb014-0c4f-48aa-a81e-36368b23297d","resolution":{"observed_at":"2026-08-08T16:55:45.514952Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14310","last_updated":"2024-03-24T18:03:10Z","snapshot_observed_at":"2026-07-06T15:31:41.985646Z","submitted_at":"2023-05-23T17:48:21Z","title":"Navigating Prompt Complexity for Zero-Shot Classification: A Study of Large Language Models in Computational Social Science","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14310","snapshot_observed_at":"2026-08-08T16:55:45.518162Z","title":"ArXivabs/2305.14310 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.518162Z"},"links":{"cited_paper":"/paper/2305.14310","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:392defefe93730e1da33aeb20cdd33a4cab3b002b9b39907411181b98c09c9bb","observation_id":"4639ae2e-21b8-4fb9-ab6f-ff2898196f44","resolution":{"observed_at":"2026-08-08T16:55:45.518162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07599","last_updated":"2023-11-10T23:41:41Z","snapshot_observed_at":"2026-08-06T09:56:47.041269Z","submitted_at":"2023-11-10T23:41:41Z","title":"Testing LLMs on Code Generation with Varying Levels of Prompt Specificity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07599","snapshot_observed_at":"2026-08-08T16:55:45.521371Z","title":"ArXivabs/2311.07599 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.521371Z"},"links":{"cited_paper":"/paper/2311.07599","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:ff048f59e1bf8f7a489a516510a0383b5837f409b8b97a7ec80992fb77ffee00","observation_id":"5f4fe807-9dfd-41fe-8f26-d703dddce000","resolution":{"observed_at":"2026-08-08T16:55:45.521371Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04746","last_updated":"2025-03-18T16:45:09Z","snapshot_observed_at":"2026-08-01T22:08:42.387961Z","submitted_at":"2024-06-07T08:46:19Z","title":"PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction","version":2},"cited_work":{"arxiv_id":"2406.04746","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.04746","snapshot_observed_at":"2026-08-08T16:55:45.787886Z","title":"PQPP: A Joint Benchmark for Text-to-Image Prompt and Query Performance Prediction","venue":"cs.CV","work_id":"1a2a12db-877b-489f-b4ff-588513acb847","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.524418Z"},"links":{"cited_paper":"/paper/2406.04746","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:9b3b04d0bcca694df691fd4596ac2aa0912963ffc6495b9bfd6877ca68354328","observation_id":"167f177b-1e6d-426a-84e8-7a3332fc9d1f","resolution":{"observed_at":"2026-08-08T16:55:45.792127Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2308.09138","last_updated":"2025-04-29T03:03:10Z","snapshot_observed_at":"2026-07-06T16:07:26.202458Z","submitted_at":"2023-08-17T18:11:33Z","title":"Semantic Consistency for Assuring Reliability of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.09138","snapshot_observed_at":"2026-08-08T16:55:45.527516Z","title":"ArXivabs/2308.09138 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.527516Z"},"links":{"cited_paper":"/paper/2308.09138","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:a1b6f973362e831d8eddc77ebf5b00369f65cb55eb3185411064f0e41a69aade","observation_id":"1c0b5fbc-294d-4adf-8817-933f07008425","resolution":{"observed_at":"2026-08-08T16:55:45.527516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.531616Z","title":"In: Proceedings of the 2024 Annual International ACM SIGIR Conference on Research and Development in Information Retrieval in the Asia Pacific Region","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.531616Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:b45cb6e2850a8409ed1be051ab2e56e8bf093496c5d2d51289dc890c5b3a3665","observation_id":"a3f0f6bb-5e0a-4821-b713-52e4edd0a935","resolution":{"observed_at":"2026-08-08T16:55:45.531616Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.159573Z","title":"In: Proceedings of the 32nd ACM Inter- national Conference on Information and Knowledge Management","venue":null,"work_id":"5c1b3736-a963-4cf0-b779-8910f2987b2c","year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.534670Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:f3becda45513f9d2bd6890c64b03800077c124b8f331ec6fd87e197b0263e098","observation_id":"38e2003d-8cca-4612-b730-81796aadcae7","resolution":{"observed_at":"2026-08-08T16:55:46.162750Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-031-56066-8_4","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.599963Z","title":"In: European Conference on Information Re- trieval.pp.30–39.Springer(2024)","venue":null,"work_id":"59dd8718-7c9b-450b-abac-ac4f38fe0e56","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.537815Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:5afe6f1770c11aac12914771f69d389f293833eb64aceca3f68c4de8760b3877","observation_id":"f4ac3d28-1374-40aa-84f8-2b7d1076fb6c","resolution":{"observed_at":"2026-08-08T16:55:45.604745Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-04T15:07:29.209129Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-08T16:55:45.540970Z","title":"arXiv preprint arXiv:2310.11324 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.540970Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:e94adb5cff844d656059d4e07edd5cf06467f7122a3a102b259e667fa104bdbe","observation_id":"11dfe6a2-4267-4f6a-ade1-3359f6563496","resolution":{"observed_at":"2026-08-08T16:55:45.540970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.149148Z","title":"In: Proceedings of the 34th International Conference on Neural Information Processing Systems","venue":null,"work_id":"7215ce34-6023-4660-9a44-11e90f6751aa","year":2020},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.544449Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:70c1e4b5f1c04ba750c78a27d9cd2fbfcaf8c136877524dfec85deb6c2b1de29","observation_id":"5502d8ec-7031-42d5-88ac-7a32dcfb7701","resolution":{"observed_at":"2026-08-08T16:55:46.152681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:46.139042Z","title":"eugeneyan.com (Aug 2024),https://eugeneyan.com/writing/llm-evaluators/","venue":null,"work_id":"ba79e65c-88ac-4031-8419-a53e3aa18aff","year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.547529Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:529a6b97af2e1a817f6bbb5d30198112809a0d6334fcc83b28da2f8ee5b19f40","observation_id":"fe230fa3-32ae-4b6d-9ef6-cd5fe05a1870","resolution":{"observed_at":"2026-08-08T16:55:46.142696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T16:55:45.550593Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.550593Z"},"links":{"citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:1cfc4b326ef5f52dfe148a494db9c471f9b220dc9beb0d5e6507d6910adb6894","observation_id":"d5ffa9f8-6bd1-4e36-88e9-5b82e781e062","resolution":{"observed_at":"2026-08-08T16:55:45.550593Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.04528","last_updated":"2024-07-16T07:29:49Z","snapshot_observed_at":"2026-08-07T20:45:44.253504Z","submitted_at":"2023-06-07T15:37:00Z","title":"PromptRobust: Towards Evaluating the Robustness of Large Language Models on Adversarial Prompts","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.04528","snapshot_observed_at":"2026-08-08T16:55:45.553837Z","title":"ArXivabs/2306.04528(2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.553837Z"},"links":{"cited_paper":"/paper/2306.04528","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:2fdc7f24b33ae4c502c9cb0b78c1c5195a93aa21bd28fc962b82a3c181e16ae1","observation_id":"b7267df2-c433-47f8-99f8-1efbc8a7c390","resolution":{"observed_at":"2026-08-08T16:55:45.553837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.12405","last_updated":"2024-10-16T09:38:13Z","snapshot_observed_at":"2026-07-06T19:34:27.813248Z","submitted_at":"2024-10-16T09:38:13Z","title":"ProSA: Assessing and Understanding the Prompt Sensitivity of LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.12405","snapshot_observed_at":"2026-08-08T16:55:45.557734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.557734Z"},"links":{"cited_paper":"/paper/2410.12405","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:269ced6e5949effdc403898f0016fee93988e65020352dc375e5374f2eab02e2","observation_id":"0396fec9-6d6e-4841-9db6-cc8f4f3a90de","resolution":{"observed_at":"2026-08-08T16:55:45.557734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T16:50:09.624997Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":2,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":5,"verified_fuzzy":11},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 3 inbound Pith citation observations for arXiv:2502.06065."}