{"as_of":"2026-08-15T04:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7680d0054eede2ca2ce2875f3ff9077eb38bbdf642e29c3286c5307e8f5ae6a2","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T01:59:51.326493Z","state":"measured"},{"denominator":160,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":160,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-14T06:32:32.682623+00:00","state":"measured"},{"denominator":96,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":96,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:32:52.510712Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":0,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-12T23:59:36.781101Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":2},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-16T18:44:49.519995Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2405.14782"},"observation_digest":"sha256:c81f53b1be95984abfc9fef16386a8c031b19027fdcb9a0b3ceeada49524cb03","observation_id":"67d1c560-d29b-4c70-b960-e933eb8b09ac","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T21:35:15.564134Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting.arXiv preprint arXiv:2310.11324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.08563","last_updated":"2024-11-13T12:21:13Z","snapshot_observed_at":"2026-08-13T09:03:40.799349Z","submitted_at":"2024-11-13T12:21:13Z","title":"Leveraging LLMs for Predictive Insights in Food Policy and Behavioral Interventions","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-12T21:35:15.564134Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.08563"},"observation_digest":"sha256:292b440d8a9fa59f55b7d9de89d13c693e192f3a0c7c902ee6de6de3fb36e1b7","observation_id":"afc502ba-3a02-4d8f-978b-05972e225180","resolution":{"observed_at":"2026-08-12T21:35:15.564134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T19:38:26.789374Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2411.10541","last_updated":"2024-11-15T19:26:38Z","snapshot_observed_at":"2026-08-14T13:06:35.039871Z","submitted_at":"2024-11-15T19:26:38Z","title":"Does Prompt Formatting Have Any Impact on LLM Performance?","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-12T19:38:26.789374Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.10541"},"observation_digest":"sha256:56feff897459fc07abc7f5dfe46b6384cdd69522780d83618b7cb06b05e9ba05","observation_id":"cf5aaaec-a456-484e-9538-44747de18621","resolution":{"observed_at":"2026-08-12T19:38:26.789374Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T17:01:31.658676Z","title":"Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.12990","last_updated":"2024-11-20T02:38:24Z","snapshot_observed_at":"2026-08-12T16:55:45.937188Z","submitted_at":"2024-11-20T02:38:24Z","title":"BetterBench: Assessing AI Benchmarks, Uncovering Issues, and Establishing Best Practices","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-12T17:01:31.658676Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.12990"},"observation_digest":"sha256:0e333d8884738f00cce213e14e31cbd7db566e0540f3e3ae418326b6a33cef79","observation_id":"b23bf9eb-c0aa-4a52-96a4-9573e21b26b9","resolution":{"observed_at":"2026-08-12T17:01:31.658676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T16:27:47.890701Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.13451","last_updated":"2024-11-20T16:54:15Z","snapshot_observed_at":"2026-08-13T17:58:34.335529Z","submitted_at":"2024-11-20T16:54:15Z","title":"AdaptAgent: Adapting Multimodal Web Agents with Few-Shot Learning from Human Demonstrations","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-12T16:27:47.890701Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.13451"},"observation_digest":"sha256:01eb5666207bad376f12f8134e772a5f3c36975c81a099fdade155fd453a4f3e","observation_id":"0a4fd0ef-9e60-46d5-a808-f148bfbb1e3f","resolution":{"observed_at":"2026-08-12T16:27:47.890701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T11:29:29.554565Z","title":"Quan- tifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2411.18191","last_updated":"2024-11-29T08:33:49Z","snapshot_observed_at":"2026-08-14T20:43:41.329249Z","submitted_at":"2024-11-27T10:14:38Z","title":"InputSnatch: Stealing Input in LLM Services via Timing Side-Channel Attacks","version":2},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-12T11:29:29.554565Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2411.18191"},"observation_digest":"sha256:7fb355f446e2041f4d442b1d5474f8b339f2d7ac1148dfabfa1160ac5737c1a0","observation_id":"3cd638b4-c102-494e-97bc-47d81fd50750","resolution":{"observed_at":"2026-08-12T11:29:29.554565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-11T22:10:22.937583Z","title":"Sclar, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.03782","last_updated":"2025-06-05T17:58:57Z","snapshot_observed_at":"2026-08-13T13:18:49.134404Z","submitted_at":"2024-12-05T00:05:11Z","title":"The broader spectrum of in-context learning","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-11T22:10:22.937583Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2412.03782"},"observation_digest":"sha256:5797dc9c303192d8982b74cc2dae41c27f6cd75841de728b065bd2aef951a5cf","observation_id":"49783f9b-3fb7-4782-bb87-16bbfa5ff718","resolution":{"observed_at":"2026-08-11T22:10:22.937583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-10T17:06:55.633108Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.12557","last_updated":"2025-01-22T00:31:51Z","snapshot_observed_at":"2026-08-14T09:34:35.457473Z","submitted_at":"2025-01-22T00:31:51Z","title":"Understanding the LLM-ification of CHI: Unpacking the Impact of LLMs at CHI through a Systematic Literature Review","version":1},"reference_index":144,"source":"pdf_text","source_observed_at":"2026-08-10T17:06:55.633108Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2501.12557"},"observation_digest":"sha256:cd860dadcb7e48c2a13b6a7c6ac9d712bfc0d28f293d43a390430d96c8ba5fc9","observation_id":"54eaeb8b-5944-4991-9dbb-49cb7d52c8a9","resolution":{"observed_at":"2026-08-10T17:06:55.633108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-10T00:49:57.082783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.18081","last_updated":"2025-01-30T01:29:46Z","snapshot_observed_at":"2026-08-13T06:37:29.757859Z","submitted_at":"2025-01-30T01:29:46Z","title":"Normative Evaluation of Large Language Models with Everyday Moral Dilemmas","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T00:49:57.082783Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2501.18081"},"observation_digest":"sha256:096f3c0aaf31b73922579f2280a38b0231863f0674e8070f607a29a8fd0caa84","observation_id":"82f21333-e037-4555-80b5-9af74df1f2ba","resolution":{"observed_at":"2026-08-10T00:49:57.082783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-08T20:08:13.553448Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.05150","last_updated":"2025-02-07T18:26:15Z","snapshot_observed_at":"2026-08-13T10:46:31.329274Z","submitted_at":"2025-02-07T18:26:15Z","title":"CodeSCM: Causal Analysis for Multi-Modal Code Generation","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-08T20:08:13.553448Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2502.05150"},"observation_digest":"sha256:a139287d276953948d7f414e6553de9666aab599dc684e0eecd5e80c2d385f50","observation_id":"d0441053-09e6-4cd6-ab56-93da98c43b82","resolution":{"observed_at":"2026-08-08T20:08:13.553448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-08T16:55:45.540970Z","title":"arXiv preprint arXiv:2310.11324 (2023)","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.06065","last_updated":"2025-02-09T23:01:03Z","snapshot_observed_at":"2026-08-10T20:00:40.576430Z","submitted_at":"2025-02-09T23:01:03Z","title":"Benchmarking Prompt Sensitivity in Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T16:55:45.540970Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2502.06065"},"observation_digest":"sha256:e263a19a3d56570cf37b2d85e0fa7ac95f0bbf5d86a6025dc5dfa6ba9a129ed2","observation_id":"11dfe6a2-4267-4f6a-ade1-3359f6563496","resolution":{"observed_at":"2026-08-08T16:55:45.540970Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-08T00:04:57.434528Z","title":"Quantifying language models' sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.08640","last_updated":"2025-02-19T06:48:30Z","snapshot_observed_at":"2026-08-15T01:33:56.348179Z","submitted_at":"2025-02-12T18:55:43Z","title":"Utility Engineering: Analyzing and Controlling Emergent Value Systems in AIs","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-08T00:04:57.434528Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2502.08640"},"observation_digest":"sha256:41c99e2910e9302ad7b452077a68846602ced4f6a928297f8b8a70154ab3c0a1","observation_id":"fff5e99a-28a3-401f-9e05-938aaa4da2a4","resolution":{"observed_at":"2026-08-08T00:04:57.434528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2502.16761","last_updated":"2026-04-16T08:22:39Z","snapshot_observed_at":"2026-07-06T20:41:23.980642Z","submitted_at":"2025-02-24T00:31:33Z","title":"Language Model Fine-Tuning on Scaled Survey Data for Predicting Distributions of Public Opinions","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2502.16761"},"observation_digest":"sha256:e94602dc6a3831c1559d8a3540be096655da4e5440eb5bfdc304b91a83f60f7b","observation_id":"9e07dffd-368e-47e8-9de9-c952a1b2c84a","resolution":{"observed_at":"2026-05-23T03:02:26.773428Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T15:02:08.057788Z","title":"Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.16648","last_updated":"2025-05-22T13:18:45Z","snapshot_observed_at":"2026-08-12T21:16:33.043406Z","submitted_at":"2025-05-22T13:18:45Z","title":"Collaboration among Multiple Large Language Models for Medical Question Answering","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T15:02:08.057788Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2505.16648"},"observation_digest":"sha256:745887f34ea0405f78e8ac9a4bc03973c0708bca6a0b27b04ba6fefd54dc8353","observation_id":"d4d06f39-afbc-4e11-947d-80b83b9585f3","resolution":{"observed_at":"2026-08-07T15:02:08.057788Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T12:05:56.757190Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting.arXiv preprint arXiv:2310.11324, 2023","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.00688","last_updated":"2025-05-31T19:43:00Z","snapshot_observed_at":"2026-08-14T14:19:01.676290Z","submitted_at":"2025-05-31T19:43:00Z","title":"Existing Large Language Model Unlearning Evaluations Are Inconclusive","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:05:56.757190Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2506.00688"},"observation_digest":"sha256:30f4334055a2b046c5778d8af83db6328f2a645a5ecdaf3363e2b73c91d1e9f9","observation_id":"b7b88fb4-20ef-490b-a7e5-975aef909afc","resolution":{"observed_at":"2026-08-07T12:05:56.757190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T11:08:12.470417Z","title":"traditional computer vision","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03360","last_updated":"2025-06-03T20:07:25Z","snapshot_observed_at":"2026-08-14T03:00:02.882917Z","submitted_at":"2025-06-03T20:07:25Z","title":"A Multimodal, Multilingual, and Multidimensional Pipeline for Fine-grained Crowdsourcing Earthquake Damage Evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:08:12.470417Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2506.03360"},"observation_digest":"sha256:4de067acfd5060efa6fd69cb791c8f75f4a7bf01a067cac36230d2edf1909879","observation_id":"7cbae61c-9af0-476c-8de6-d50f1e5c1aa3","resolution":{"observed_at":"2026-08-07T11:08:12.470417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T10:59:06.932061Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03923","last_updated":"2025-06-04T13:15:01Z","snapshot_observed_at":"2026-08-14T16:53:35.362125Z","submitted_at":"2025-06-04T13:15:01Z","title":"More or Less Wrong: A Benchmark for Directional Bias in LLM Comparative Reasoning","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T10:59:06.932061Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2506.03923"},"observation_digest":"sha256:c69bcb5bff782ec72726a50ff3b77a41213e6d1232c9c43f06856ef9f477a294","observation_id":"32d913c0-1673-4981-82e1-4f9a59691a1f","resolution":{"observed_at":"2026-08-07T10:59:06.932061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T10:45:03.052746Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.04482","last_updated":"2025-06-04T22:01:31Z","snapshot_observed_at":"2026-08-14T20:45:59.809848Z","submitted_at":"2025-06-04T22:01:31Z","title":"Understanding and Meeting Practitioner Needs When Measuring Representational Harms Caused by LLM-Based Systems","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-07T10:45:03.052746Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2506.04482"},"observation_digest":"sha256:e0d7a02530b20550584f14406c19a17e44a969010bf4567056e9e66ea698c40c","observation_id":"45ab169e-069f-4672-a7ee-8567bcce31df","resolution":{"observed_at":"2026-08-07T10:45:03.052746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-06T23:42:28.044768Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.16697","last_updated":"2025-06-20T02:38:42Z","snapshot_observed_at":"2026-08-13T15:23:41.173013Z","submitted_at":"2025-06-20T02:38:42Z","title":"From Prompts to Constructs: A Dual-Validity Framework for LLM Research in Psychology","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-06T23:42:28.044768Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2506.16697"},"observation_digest":"sha256:8fd63c9a6dc893b5a436d6d0254ddf9a08d4fad9a8d50a1ab72fe3c82d0c950f","observation_id":"34196dfb-50c7-4c67-a110-faae8e7dc90c","resolution":{"observed_at":"2026-08-06T23:42:28.044768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-06T20:23:07.707797Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How I learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02858","last_updated":"2025-07-03T17:59:04Z","snapshot_observed_at":"2026-08-09T17:36:35.582190Z","submitted_at":"2025-07-03T17:59:04Z","title":"Requirements Elicitation Follow-Up Question Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-06T20:23:07.707797Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2507.02858"},"observation_digest":"sha256:4178bf17f601128ee16080538ba198b254d3a76f9afe255813e49c4f1ba8e983","observation_id":"4fab458f-9a4d-40f5-b211-9ed2da36fff3","resolution":{"observed_at":"2026-08-06T20:23:07.707797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2507.14913","last_updated":"2026-04-05T11:35:06Z","snapshot_observed_at":"2026-08-05T18:40:44.179056Z","submitted_at":"2025-07-20T10:55:29Z","title":"PromptSuite: A Task-Agnostic Framework for Multi-Prompt Generation","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-19T03:43:28.543349Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2507.14913"},"observation_digest":"sha256:286164239ec8fa9c798bfae1418bc47005e63ec89647e013cb24786e34797c46","observation_id":"3a2ea975-db5b-4873-ae31-2c52ef77f146","resolution":{"observed_at":"2026-05-19T03:47:02.410931Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-06T14:26:03.490201Z","title":", Choi, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2508.06503","last_updated":"2025-07-25T15:56:25Z","snapshot_observed_at":"2026-08-12T15:06:30.584452Z","submitted_at":"2025-07-25T15:56:25Z","title":"Understanding Human Limits in Pattern Recognition: A Computational Model of Sequential Reasoning in Rock, Paper, Scissors","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-06T14:26:03.490201Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2508.06503"},"observation_digest":"sha256:ca7a948b489ba604f4aaa4fe687299d5275db3e7095ba4a77f3705fde6f6af3a","observation_id":"b6dd6aea-528c-453c-bae2-a93bc18b02e6","resolution":{"observed_at":"2026-08-06T14:26:03.490201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T17:13:52.950973Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting.arXiv preprint arXiv:2310.11324, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.00038","last_updated":"2025-08-22T21:37:49Z","snapshot_observed_at":"2026-08-05T23:50:11.524380Z","submitted_at":"2025-08-22T21:37:49Z","title":"Compiling Prompts, Not Crafting Them: A Reproducible Workflow for AI-Assisted Evidence Synthesis","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-05T17:13:52.950973Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.00038"},"observation_digest":"sha256:1c3626b46642394ca4c3a455d0e3cd4cd4911391ffe3b04874327b3be84db54b","observation_id":"6230737b-69d8-4d1e-8bf6-a0bf9e508377","resolution":{"observed_at":"2026-08-05T17:13:52.950973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T12:17:20.371226Z","title":"Transactions of the Association for Com- putational Linguistics, 7:249–266","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.01790","last_updated":"2025-09-01T21:38:28Z","snapshot_observed_at":"2026-08-12T03:56:04.901723Z","submitted_at":"2025-09-01T21:38:28Z","title":"Flaw or Artifact? Rethinking Prompt Sensitivity in Evaluating LLMs","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-05T12:17:20.371226Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.01790"},"observation_digest":"sha256:8df6345f4c316bebfadeb5cb943225c6a7f4b4619ed7ac3aaf173025fff3261e","observation_id":"950659b2-ed32-4383-a1da-4e75ab68be5f","resolution":{"observed_at":"2026-08-05T12:17:20.371226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-04T21:22:14.357858Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.08075","last_updated":"2025-09-09T18:30:01Z","snapshot_observed_at":"2026-08-12T18:58:31.147712Z","submitted_at":"2025-09-09T18:30:01Z","title":"No for Some, Yes for Others: Persona Prompts and Other Sources of False Refusal in Language Models","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T21:22:14.357858Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.08075"},"observation_digest":"sha256:f94ebfdb44f1f8f62f6a6900d77c22377f1b2b9a2fbd3959b992eca0bda831c0","observation_id":"3c0c6ae2-382e-4d24-b1ab-c7c9c75339c6","resolution":{"observed_at":"2026-08-04T21:22:14.357858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-04T19:27:04.897757Z","title":"Sclar , author Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.09303","last_updated":"2025-09-11T09:44:16Z","snapshot_observed_at":"2026-08-12T15:05:32.689367Z","submitted_at":"2025-09-11T09:44:16Z","title":"From scratch to silver: Creating trustworthy training data for patent-SDG classification using Large Language Models","version":1},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-08-04T19:27:04.897757Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.09303"},"observation_digest":"sha256:3d149fb38a5cf3e12c3b81bcc96b543584fedd618c9639bc4820122761c7cf3f","observation_id":"8094e4a3-c2f5-4e28-b429-c33515ecf71b","resolution":{"observed_at":"2026-08-04T19:27:04.897757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-04T20:19:50.468699Z","title":"Sclar, Y","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09735","last_updated":"2025-09-10T14:25:09Z","snapshot_observed_at":"2026-08-12T15:07:22.451648Z","submitted_at":"2025-09-10T14:25:09Z","title":"Discrimination by LLMs: Cross-lingual Bias Assessment and Mitigation in Decision-Making and Summarisation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T20:19:50.468699Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.09735"},"observation_digest":"sha256:acbabc7126feeb68dd91e2ae9017e0c228b4ff8d23f8ad856b26a419d901697d","observation_id":"b551cc06-294f-4c30-a9f9-467c782b935b","resolution":{"observed_at":"2026-08-04T20:19:50.468699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-04T20:19:50.473280Z","title":"URL https://doi.org/10","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.09735","last_updated":"2025-09-10T14:25:09Z","snapshot_observed_at":"2026-08-12T15:07:22.451648Z","submitted_at":"2025-09-10T14:25:09Z","title":"Discrimination by LLMs: Cross-lingual Bias Assessment and Mitigation in Decision-Making and Summarisation","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T20:19:50.473280Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.09735"},"observation_digest":"sha256:49d0749eb1983bb194d4adab06c197f8e5c32204b09c63b012c721f619af118f","observation_id":"1048b3db-c417-4803-8f34-526566bf1e09","resolution":{"observed_at":"2026-08-04T20:19:50.473280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2509.19590","last_updated":"2026-05-16T01:07:51Z","snapshot_observed_at":"2026-07-06T22:30:36.671861Z","submitted_at":"2025-09-23T21:29:04Z","title":"Position: AI Evaluations Should be Grounded on a Theory of Capability","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-21T21:57:55.834632Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2509.19590"},"observation_digest":"sha256:4e378be02124f008cfb5f517216961e0121fe255acd0a048c3283ba7d8cfa30e","observation_id":"0196a771-86c1-43c1-b180-a3060c8fcad1","resolution":{"observed_at":"2026-05-21T22:00:41.479428Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2510.04309","last_updated":"2026-05-16T04:44:41Z","snapshot_observed_at":"2026-08-14T20:28:58.911133Z","submitted_at":"2025-10-05T18:05:28Z","title":"Activation Steering with a Feedback Controller","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-21T21:50:05.186376Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2510.04309"},"observation_digest":"sha256:dd675337de1de1d0e7f1135e9fb73cfd5d70b6e31319efab7b6199cf596d2942","observation_id":"f113b980-247b-40cb-9faf-2fa1e4ab22bb","resolution":{"observed_at":"2026-05-21T21:50:41.383188Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-03T09:36:34.579749Z","title":"P., Nelson, L","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2601.13330","last_updated":"2026-07-13T13:57:34Z","snapshot_observed_at":"2026-08-06T13:00:14.903284Z","submitted_at":"2026-01-19T19:10:45Z","title":"RegCheck: A tool for structured comparisons between study registrations and papers","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T09:36:34.579749Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2601.13330"},"observation_digest":"sha256:6d726a9ac221165107c9cd3fe310b88e7650fef25ee39006bf6d02fdd8aae968","observation_id":"a3f56d2a-92ff-4ca4-95a4-967095642230","resolution":{"observed_at":"2026-08-03T09:36:34.579749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-03T09:36:34.417517Z","title":"(2013, April)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.13330","last_updated":"2026-07-13T13:57:34Z","snapshot_observed_at":"2026-08-06T13:00:14.903284Z","submitted_at":"2026-01-19T19:10:45Z","title":"RegCheck: A tool for structured comparisons between study registrations and papers","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T09:36:34.417517Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2601.13330"},"observation_digest":"sha256:4d47a6fc8f15a916cf2d1e5fbc1821048b566323a3b77abd8b3e1c564b792dd9","observation_id":"eb725fc7-ab55-474c-8cc3-d4fbcb21f1dc","resolution":{"observed_at":"2026-08-03T09:36:34.417517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-03T07:03:14.824744Z","title":"Smith, and Hannaneh Hajishirzi","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2601.21433","last_updated":"2026-07-08T17:11:16Z","snapshot_observed_at":"2026-08-14T15:38:26.653874Z","submitted_at":"2026-01-29T09:09:23Z","title":"Framing Instability in LLM Ethical Stance: Auditing Negation Sensitivity in Moral Dilemmas","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T07:03:14.824744Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2601.21433"},"observation_digest":"sha256:55e2376cff4a23f8d51526598d6524e03abcb3fe2c23185bd19b9ec93dfda89d","observation_id":"a0b70b9e-7ec7-4425-9461-f809d8b0a067","resolution":{"observed_at":"2026-08-03T07:03:14.824744Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-02T23:00:27.287919Z","title":"Quantifying language models' sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2602.15278","last_updated":"2026-05-31T02:07:13Z","snapshot_observed_at":"2026-08-08T02:47:52.848942Z","submitted_at":"2026-02-17T00:33:53Z","title":"Visual Persuasion: What Influences Decisions of Vision-Language Models?","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-02T23:00:27.287919Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2602.15278"},"observation_digest":"sha256:dabd7e1f93933f376b9081258f2e89a5eba05988fd0e13406c7b66f74ee6d83a","observation_id":"59a49e8a-dbed-4b47-8ff8-9afa1e692aa5","resolution":{"observed_at":"2026-08-02T23:00:27.287919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2603.09127","last_updated":"2026-04-03T23:37:21Z","snapshot_observed_at":"2026-08-14T15:20:48.843312Z","submitted_at":"2026-03-10T02:59:11Z","title":"Collective AI can amplify tiny perturbations into divergent decisions","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-15T14:24:13.562656Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2603.09127"},"observation_digest":"sha256:fc5931485391db276719c7c89ce4ae02f2be716bc717042430f395011d1c62c8","observation_id":"5639a345-b6f2-4d0f-a369-79ee60fb985f","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2603.22161","last_updated":"2026-05-19T14:46:51Z","snapshot_observed_at":"2026-08-12T16:18:54.458115Z","submitted_at":"2026-03-23T16:23:31Z","title":"Causal Evidence that Language Models use Confidence to Drive Behavior","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-21T09:43:05.524088Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2603.22161"},"observation_digest":"sha256:ec5559071d9247453083124d23faec5c71dff9b88ae5d4deff5564e7f79a815c","observation_id":"c4363e52-b8a2-456a-8a84-b2de1811b75a","resolution":{"observed_at":"2026-05-21T09:44:05.678228Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-13T13:46:54.451163Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design.arXiv preprint arXiv:2310.11324, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2604.02607","last_updated":"2026-06-04T23:33:21Z","snapshot_observed_at":"2026-08-14T21:44:29.330217Z","submitted_at":"2026-04-03T00:52:20Z","title":"Dual Implications of Quark Mass Hierarchies to Flavor Structure","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-13T13:46:54.451163Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.02607"},"observation_digest":"sha256:7dc99b68d2b0a40a9a6a7f0bbd3413674913ef3b6cdafcb1f5305771f6951c07","observation_id":"f0ab09b1-d23b-4100-a869-6a77e807a213","resolution":{"observed_at":"2026-07-13T13:46:54.451163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2604.02608","last_updated":"2026-05-08T22:54:43Z","snapshot_observed_at":"2026-08-11T02:35:21.811469Z","submitted_at":"2026-04-03T00:54:11Z","title":"Steerable but Not Decodable: Function Vectors Operate Beyond the Logit Lens","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T20:59:02.824707Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.02608"},"observation_digest":"sha256:e29871cacc60eb61b0bf90acaf8af70265728ec6ca45c15096af928cc0b6a5f1","observation_id":"f5077a94-b1f6-4337-b9bb-dd86afecd2eb","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2604.07745","last_updated":"2026-04-09T03:03:06Z","snapshot_observed_at":"2026-08-02T14:47:37.509813Z","submitted_at":"2026-04-09T03:03:06Z","title":"The Cartesian Cut in Agentic AI","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-10T17:54:45.333038Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.07745"},"observation_digest":"sha256:fa5cad9b68d2a8ed01086c3b96c8422b489c70d88d4587ab96e33428c1c403c0","observation_id":"6a0da57e-c6c1-45ef-b2e3-5dade4b334c6","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2604.11328","last_updated":"2026-04-13T11:31:04Z","snapshot_observed_at":"2026-08-12T15:04:44.243472Z","submitted_at":"2026-04-13T11:31:04Z","title":"Select Smarter, Not More: Prompt-Aware Evaluation Scheduling with Submodular Guarantees","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-10T15:47:45.677717Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.11328"},"observation_digest":"sha256:29bf023d10450f9506879d408833cb3bf8941c5e84ece69d41dafa725d5c55a6","observation_id":"4e800469-e96b-4d01-974b-b63e89638940","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2604.14197","last_updated":"2026-04-03T03:06:03Z","snapshot_observed_at":"2026-08-13T06:13:00.784807Z","submitted_at":"2026-04-03T03:06:03Z","title":"The PICCO Framework for Large Language Model Prompting: A Taxonomy and Reference Architecture for Prompt Structure","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T20:00:19.061076Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.14197"},"observation_digest":"sha256:35854cedf8018535e3bbbbd0f3171907728ebdd2c1af563273c63cd291692793","observation_id":"fd3276a5-c025-4ae0-8bfe-3e05b32ad1b8","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2604.14672","last_updated":"2026-04-16T06:30:34Z","snapshot_observed_at":"2026-08-12T23:02:57.889301Z","submitted_at":"2026-04-16T06:30:34Z","title":"SPAGBias: Uncovering and Tracing Structured Spatial Gender Bias in Large Language Models","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-10T11:52:49.311085Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2604.14672"},"observation_digest":"sha256:5bf6b9e0b0ec595e15a14bfd29d197a3b7b219d155887b6428f46b18a7251cb2","observation_id":"fd771154-d352-40ab-a386-13d231096e1b","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.01048","last_updated":"2026-05-01T19:23:33Z","snapshot_observed_at":"2026-08-11T09:42:32.928404Z","submitted_at":"2026-05-01T19:23:33Z","title":"Compared to What? Baselines and Metrics for Counterfactual Prompting","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-09T19:02:46.991897Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.01048"},"observation_digest":"sha256:fe1ff2bd841a3d1109d9450ffb95969216a74c264febd40ccc5e509a961586db","observation_id":"b656be60-9453-48e1-b04d-c00fc60baf97","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.02038","last_updated":"2026-05-03T20:05:08Z","snapshot_observed_at":"2026-08-12T17:13:42.783085Z","submitted_at":"2026-05-03T20:05:08Z","title":"What Single-Prompt Accuracy Misses: A Multi-Variant Reliability Audit of Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-08T19:28:46.547245Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.02038"},"observation_digest":"sha256:18a2355580ca0ce7587a7a96dc0836eb0d1a16ec254eb5aab7f65744fd039b87","observation_id":"b3540b05-1e28-4ba6-9009-187f14869d22","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.03111","last_updated":"2026-05-04T19:49:22Z","snapshot_observed_at":"2026-08-15T03:56:27.451695Z","submitted_at":"2026-05-04T19:49:22Z","title":"Benchmarking Local Language Models for Social Robots using Edge Devices","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-08T17:42:32.154484Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.03111"},"observation_digest":"sha256:a073ae41fd8980d76b90a6b9049915a60edca5827d966cfbb33ddaf24ea52df2","observation_id":"9b7c6f9c-0405-434b-a17f-816941b1d01a","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.04665","last_updated":"2026-05-09T22:09:59Z","snapshot_observed_at":"2026-08-14T04:49:55.193342Z","submitted_at":"2026-05-06T09:11:10Z","title":"Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-08T16:26:54.068997Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.04665"},"observation_digest":"sha256:3692d360d74564214a8d58a0f309787a23b01fda364638aeb16ed70f6d22cccf","observation_id":"98600158-a739-4ef0-b0b4-de4212556679","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.04665","last_updated":"2026-05-09T22:09:59Z","snapshot_observed_at":"2026-08-14T04:49:55.193342Z","submitted_at":"2026-05-06T09:11:10Z","title":"Paraphrase-Induced Output-Mode Collapse: When LLMs Break Character Under Semantically Equivalent Inputs","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-12T02:13:48.672711Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.04665"},"observation_digest":"sha256:8874a270cea048ad70215fd2cbaae16d0f4949272f6cf458b0f382632b9b1087","observation_id":"83ff963b-d838-4c2d-a198-21f2622ffc4f","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.06161","last_updated":"2026-05-07T12:49:09Z","snapshot_observed_at":"2026-08-14T15:17:42.756552Z","submitted_at":"2026-05-07T12:49:09Z","title":"Beyond Accuracy: Policy Invariance as a Reliability Test for LLM Safety Judges","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-08T10:23:58.198464Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.06161"},"observation_digest":"sha256:5d02175252938f2595caa77c7ecf1e9625ccba81725dade80c6023fe1ae65a4e","observation_id":"975fbeb2-490a-4282-bb4a-d5cd8db7c00f","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.06327","last_updated":"2026-05-07T14:23:31Z","snapshot_observed_at":"2026-08-15T01:17:54.442017Z","submitted_at":"2026-05-07T14:23:31Z","title":"Measuring Evaluation-Context Divergence in Open-Weight LLMs: A Paired-Prompt Protocol with Pilot Evidence of Alignment-Pipeline-Specific Heterogeneity","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-08T10:23:02.697982Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.06327"},"observation_digest":"sha256:3958340684208b1b054aa444d71a2ea5c9e0bd1901f14b1cebe71473d4798271","observation_id":"b6f3d18d-dbf1-4f98-a18e-3f42002bc3b8","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.06656","last_updated":"2026-05-07T17:57:58Z","snapshot_observed_at":"2026-08-12T17:20:46.232380Z","submitted_at":"2026-05-07T17:57:58Z","title":"Why Global LLM Leaderboards Are Misleading: Small Portfolios for Heterogeneous Supervised ML","version":1},"reference_index":293,"source":"arxiv_source","source_observed_at":"2026-05-08T12:05:32.881629Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.06656"},"observation_digest":"sha256:6f37bbc4b34c99cac79d7c94c91cfb15adf0a108f91259338b7546c02e01f4b2","observation_id":"34ae1dde-d9bf-479c-bce8-692524314ae3","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.07186","last_updated":"2026-05-08T03:26:42Z","snapshot_observed_at":"2026-08-13T17:47:54.136413Z","submitted_at":"2026-05-08T03:26:42Z","title":"The Text Uncanny Valley: Non-Monotonic Performance Degradation in LLM Information Retrieval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-11T02:53:07.297356Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.07186"},"observation_digest":"sha256:b3393da89cce61e4754c065239de34747b1166cd04e43306fa70d41a01b97eb5","observation_id":"f333364e-a655-438f-9a68-0ccb8934eee6","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.07830","last_updated":"2026-05-08T14:57:53Z","snapshot_observed_at":"2026-08-13T04:51:01.207142Z","submitted_at":"2026-05-08T14:57:53Z","title":"CyBiasBench: Benchmarking Bias in LLM Agents for Cyber-Attack Scenarios","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-11T01:54:46.391345Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.07830"},"observation_digest":"sha256:878f8a447dd47ef4c982da099dc01184aba9becb60793e7df8031c3aa907fe12","observation_id":"c80d12c3-6a2f-40a8-a7f5-cfb844a17bd0","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.08455","last_updated":"2026-05-26T07:39:54Z","snapshot_observed_at":"2026-08-11T00:35:00.640352Z","submitted_at":"2026-05-08T20:24:32Z","title":"CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-12T01:43:06.644640Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.08455"},"observation_digest":"sha256:da9ececaabe5d387392d738e25ca8e5fe56e2fd21ea632451b05dc50af2bfcde","observation_id":"b4349365-f316-4c16-aa26-d9233aba4688","resolution":{"observed_at":"2026-05-17T01:59:51.558892Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.08455","last_updated":"2026-05-26T07:39:54Z","snapshot_observed_at":"2026-08-11T00:35:00.640352Z","submitted_at":"2026-05-08T20:24:32Z","title":"CUDABeaver: Benchmarking LLM-Based Automated CUDA Debugging","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-30T22:54:20.299335Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.08455"},"observation_digest":"sha256:3f489bb4aa96bf399b6759cf6b561807819002d6f7226a5d4b4ed523afd20ab5","observation_id":"526d97db-3377-46d5-baa0-7ba430a84b00","resolution":{"observed_at":"2026-07-01T13:35:46.961576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.18194","last_updated":"2026-05-18T10:32:56Z","snapshot_observed_at":"2026-08-15T02:33:49.999981Z","submitted_at":"2026-05-18T10:32:56Z","title":"Beyond the Cartesian Illusion: Testing Two-Stage Multi-Modal Theory of Mind under Perceptual Bottlenecks","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-20T10:10:31.059095Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.18194"},"observation_digest":"sha256:63c8e39010c4f4c3a5ead2cc2d3d77ef76a93a070c36558856f190c9d0195972","observation_id":"49678d8d-4a34-418b-a548-c911ef1878f8","resolution":{"observed_at":"2026-05-20T10:13:11.910514Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.18890","last_updated":"2026-05-17T00:21:53Z","snapshot_observed_at":"2026-08-04T03:29:34.208507Z","submitted_at":"2026-05-17T00:21:53Z","title":"Stop Drawing Scientific Claims from LLM Social Simulations Without Robustness Audits","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-20T13:40:04.275438Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.18890"},"observation_digest":"sha256:d401e2a810e7d0319790ce1dd138bf98dc1a8e612f5f5d053e849ee20ac4bfb0","observation_id":"3355f211-f632-46a9-b56f-75db36161e2f","resolution":{"observed_at":"2026-05-20T13:43:19.588773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.20994","last_updated":"2026-05-20T10:33:11Z","snapshot_observed_at":"2026-08-14T10:56:10.365377Z","submitted_at":"2026-05-20T10:33:11Z","title":"Towards Context-Invariant Safety Alignment for Large Language Models","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-21T05:36:12.562807Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.20994"},"observation_digest":"sha256:b682ca9dd71017cbad0dd994193e51f584f59cee7e49263f4cb1e6f02bad57ac","observation_id":"98ca3752-a808-47be-b31d-4478a0c7e66a","resolution":{"observed_at":"2026-05-21T05:39:40.847530Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.25492","last_updated":"2026-05-25T06:54:44Z","snapshot_observed_at":"2026-08-12T16:53:10.120337Z","submitted_at":"2026-05-25T06:54:44Z","title":"SafetyRepro: Configuration-Conditional Rank Instability on Alignment Benchmarks","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-29T22:50:48.263600Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.25492"},"observation_digest":"sha256:0e195dbfee64c0f9b1e981a7dbc755d93cd4b97df9afbbb842865ac335bf47c0","observation_id":"dd1d57e0-4ee4-4a65-90ef-28dd879c1439","resolution":{"observed_at":"2026-06-29T22:54:00.992662Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.27440","last_updated":"2026-05-22T17:23:02Z","snapshot_observed_at":"2026-08-14T22:26:40.416688Z","submitted_at":"2026-05-22T17:23:02Z","title":"Paraphrase Brittleness in Production Retrieval-Augmented Commercial Recommendation: Reproducibility Below the Rerun-Stability Baseline","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-30T14:44:45.353335Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.27440"},"observation_digest":"sha256:3a8c51069d5f19a9a823f66f82fe71980fa2f987979558eb955796d41d9dc819","observation_id":"2a250451-02d6-4609-8150-551b576494b5","resolution":{"observed_at":"2026-06-30T14:54:45.706466Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.27706","last_updated":"2026-05-26T21:28:51Z","snapshot_observed_at":"2026-08-09T22:31:48.163230Z","submitted_at":"2026-05-26T21:28:51Z","title":"Chain-based Adaptive Reconfiguration Over Lattices for Hallucination Reduction","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.27706"},"observation_digest":"sha256:613baab46f41dfeabd6b0acdb979814b57705d691af02ecdc0fb41c28f25a46f","observation_id":"65addb7c-8ece-4002-9a36-c4a24c3c2aff","resolution":{"observed_at":"2026-06-29T18:13:48.306109Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-12T22:27:01.885350Z","title":"Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design.arXiv preprint arXiv:2310.11324,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2605.28838","last_updated":"2026-04-12T13:40:30Z","snapshot_observed_at":"2026-08-15T02:50:22.354173Z","submitted_at":"2026-04-12T13:40:30Z","title":"Specialty-Specific Medical Language Model for Immune-Mediated Diseases","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-12T22:27:01.885350Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.28838"},"observation_digest":"sha256:8b4c7ef67175cd4b72d0446964c7895292182385bd8818a4f817a3eb4ea19852","observation_id":"532c76cf-ba79-4c40-ad63-cc7413ad183f","resolution":{"observed_at":"2026-07-12T22:27:01.885350Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.28840","last_updated":"2026-04-23T16:06:03Z","snapshot_observed_at":"2026-08-07T14:35:09.129059Z","submitted_at":"2026-04-23T16:06:03Z","title":"How Consistent Are LLM Agents? Measuring Behavioral Reproducibility in Multi-Step Tool-Calling Pipelines","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-07-04T21:40:04.594380Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.28840"},"observation_digest":"sha256:8d948232dde7f048c3d033f235961d3adabcafa538a4bd20298c8ea3790650c3","observation_id":"b750e918-9a7b-430d-a5cb-c5eef6908d31","resolution":{"observed_at":"2026-07-04T21:40:08.966556Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.29027","last_updated":"2026-05-27T19:23:46Z","snapshot_observed_at":"2026-08-07T20:12:54.992928Z","submitted_at":"2026-05-27T19:23:46Z","title":"Mind Your Tone: Does Tone Alter LLM Performance?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-29T12:19:51.838450Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.29027"},"observation_digest":"sha256:0f4891e026068ad670cd628a0378e1dcd26a6f2dbfd3578832f18c16ebae3f4e","observation_id":"4c8908a7-5104-4e75-b152-b9504f050c72","resolution":{"observed_at":"2026-06-29T12:23:23.829759Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.30207","last_updated":"2026-05-28T16:43:38Z","snapshot_observed_at":"2026-08-06T12:32:03.164357Z","submitted_at":"2026-05-28T16:43:38Z","title":"Persona Conditioning of Brand Recommendations in Retrieval-Augmented Commercial Chat: A Prominence-Stratified Cross-Provider Audit","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-29T07:20:32.538522Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.30207"},"observation_digest":"sha256:1992e5c9f4b2f03b67ad26195ba59ed04b9a88b95d527ed0b80b78f4283212fc","observation_id":"2a0ffda8-a8a4-46bc-abc3-8f524e2a89ca","resolution":{"observed_at":"2026-06-29T07:23:12.704384Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.30646","last_updated":"2026-05-28T23:03:43Z","snapshot_observed_at":"2026-08-07T13:40:49.056190Z","submitted_at":"2026-05-28T23:03:43Z","title":"Same Patient, Different Words, Different Diagnosis? Evaluating Semantic Stability in Clinical LLMs","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-29T07:14:22.444020Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.30646"},"observation_digest":"sha256:d6da232c7aed0e459eeec917fc609bade8f91a50d2f73573743aa5485c3d0d6e","observation_id":"f2bf329c-cc47-4e49-aec3-76de5a68e488","resolution":{"observed_at":"2026-06-29T07:23:13.270260Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2605.30790","last_updated":"2026-05-29T03:26:41Z","snapshot_observed_at":"2026-08-07T18:18:14.659264Z","submitted_at":"2026-05-29T03:26:41Z","title":"On the impact of retrieved content representations in RAG Pipelines","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-06-28T21:20:41.309842Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2605.30790"},"observation_digest":"sha256:65586c0fab15e964dfe68f3b8b8bfb06426016f5cd89604e7c719902cbe42c46","observation_id":"35f46b7d-ee0d-45b8-b27a-509280c3a4ee","resolution":{"observed_at":"2026-07-01T20:16:12.164754Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.03810","last_updated":"2026-06-03T10:22:34Z","snapshot_observed_at":"2026-08-09T08:08:54.753923Z","submitted_at":"2026-06-02T15:54:24Z","title":"Consistency Training Can Entrench Misalignment","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-06-28T10:07:31.153337Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.03810"},"observation_digest":"sha256:21774d0cb6dd67649eb69811f2a2e03bb6f7d1131d26c12888aa701bf693874a","observation_id":"9be348f7-4089-4696-8886-d694bcc3defb","resolution":{"observed_at":"2026-07-02T03:26:28.642293Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.04781","last_updated":"2026-06-03T12:02:49Z","snapshot_observed_at":"2026-08-12T14:43:39.047557Z","submitted_at":"2026-06-03T12:02:49Z","title":"AIP: A Graph Representation for Learning and Governing Agent Skills","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T05:58:37.538980Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.04781"},"observation_digest":"sha256:077abf9598a48b44916ceba4ff91f67347745c7f55313ccc2d1ba41315553fae","observation_id":"2b1fce16-aaa5-425c-bdd7-c036efbc2c5f","resolution":{"observed_at":"2026-07-02T08:36:47.780631Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.05384","last_updated":"2026-06-03T19:37:23Z","snapshot_observed_at":"2026-08-05T20:30:23.980379Z","submitted_at":"2026-06-03T19:37:23Z","title":"Stability vs. Manipulability: Evaluating Robustness Under Post-Decision Interaction in LLM Judges","version":1},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-06-28T05:58:59.870335Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.05384"},"observation_digest":"sha256:4f9b4a832f1ad38afa27fa41868321286cf18663197dd02679aa67e0dddbf1d7","observation_id":"15aecd79-a8fd-4cdd-8e56-ab18ad9839f6","resolution":{"observed_at":"2026-07-02T08:36:47.667751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.09498","last_updated":"2026-08-12T16:54:29Z","snapshot_observed_at":"2026-08-15T04:12:53.084624Z","submitted_at":"2026-06-08T13:50:23Z","title":"Self-Harness: Harnesses That Improve Themselves","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-27T16:25:59.583722Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.09498"},"observation_digest":"sha256:837190959c434bc2ebfb86d7ef9619ac36d567304ec3d3ccd05b9b2f0d2a8c3d","observation_id":"484c52d7-3061-452d-9891-7327bd6971d1","resolution":{"observed_at":"2026-07-03T01:37:30.768446Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.10657","last_updated":"2026-06-09T10:05:20Z","snapshot_observed_at":"2026-08-12T15:06:31.319814Z","submitted_at":"2026-06-09T10:05:20Z","title":"Are We Evaluating Knowledge or Phrasing? Mitigating MCQA Sensitivity with ParaEval","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-27T13:13:21.687950Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.10657"},"observation_digest":"sha256:84e9965ff8ce793a3bce420c07c9e926f586c6c1424d82e8c9fcfdc2e5891edb","observation_id":"925b5beb-4f5a-4615-89d0-f13eb0d0586b","resolution":{"observed_at":"2026-07-03T05:27:40.336372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.11217","last_updated":"2026-05-03T19:57:27Z","snapshot_observed_at":"2026-08-13T11:02:55.923480Z","submitted_at":"2026-05-03T19:57:27Z","title":"Preregistration for Experiments with AI Agents","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-07-01T00:14:42.159357Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.11217"},"observation_digest":"sha256:4cad26c2fe4b4b328e5dc45ffbbdb7aa21292eca71daeb6ad71e7faf13345c1f","observation_id":"abd1163d-84b0-4ee9-bd69-342245e3dc8a","resolution":{"observed_at":"2026-07-01T00:15:08.983043Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.25191","last_updated":"2026-06-23T21:34:23Z","snapshot_observed_at":"2026-08-06T07:24:43.933840Z","submitted_at":"2026-06-23T21:34:23Z","title":"To Isolate or to Score? Model-Adaptive Assessment for Cost-Efficient Multi-Agent RAG","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-06-25T22:44:43.951083Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.25191"},"observation_digest":"sha256:1001c955c0eb39ced18e00aef9934d867fd662859509020bd9a9f07a6d11cc4f","observation_id":"61da2415-daca-4f13-9f56-221c666c47ee","resolution":{"observed_at":"2026-07-04T18:40:02.339892Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.26356","last_updated":"2026-06-24T20:09:28Z","snapshot_observed_at":"2026-08-03T13:55:34.475640Z","submitted_at":"2026-06-24T20:09:28Z","title":"Instruction Bleed: Cross-Module Interference in Prompt-Composed Agentic Systems","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-26T01:42:22.071423Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.26356"},"observation_digest":"sha256:f8d122827a20a841ebb3716c452effaeaf8090a505cba37607e13552fa6d4c58","observation_id":"d007a58f-9e84-473f-97f8-cc5aed4a3759","resolution":{"observed_at":"2026-07-04T15:19:56.816194Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.26924","last_updated":"2026-06-25T12:02:18Z","snapshot_observed_at":"2026-07-07T00:01:10.711037Z","submitted_at":"2026-06-25T12:02:18Z","title":"A Deterministic Control Plane for LLM Coding Agents","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-06-26T03:58:28.523545Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.26924"},"observation_digest":"sha256:a643b7d369c2427da31df6ff4671d39bc2c5014dcb0a0eeebe53658e3efe5692","observation_id":"26506fa3-9f47-42c5-a0e4-2f67a613a2a0","resolution":{"observed_at":"2026-07-04T14:19:54.749800Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.29933","last_updated":"2026-06-29T08:09:55Z","snapshot_observed_at":"2026-08-07T13:44:57.008415Z","submitted_at":"2026-06-29T08:09:55Z","title":"Towards Physical Intuitions for Alignment Dynamics: A Case Study With Randomness Crystallization","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-06-30T06:39:32.596823Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.29933"},"observation_digest":"sha256:c513265b918bd380153199748c3b3cc3755a42881a14d3ec4b628506ff61c42e","observation_id":"477d1fd4-b47e-44a5-b56a-38f93edfa261","resolution":{"observed_at":"2026-06-30T06:44:19.133463Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2606.31511","last_updated":"2026-06-30T11:26:14Z","snapshot_observed_at":"2026-08-14T01:55:19.794986Z","submitted_at":"2026-06-30T11:26:14Z","title":"Falsification, Not Exposure: An Internally Preregistered Placebo-Controlled Decomposition of Self-Repair Feedback in Frozen Small Code Models","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-07-01T04:44:56.520156Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2606.31511"},"observation_digest":"sha256:5eb58bd8ebc727089482fd39a717311eb83c66e6e5db9304115fe86e482b4f55","observation_id":"1b62b622-50c2-4937-8790-2dcd97e20740","resolution":{"observed_at":"2026-07-01T11:05:42.229723Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2607.00403","last_updated":"2026-07-01T04:01:26Z","snapshot_observed_at":"2026-08-13T17:30:30.432554Z","submitted_at":"2026-07-01T04:01:26Z","title":"A Penny for Your Prompts: Experiments Detecting and Mitigating LLM Usage by Survey Respondents","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-02T06:58:41.513964Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.00403"},"observation_digest":"sha256:ddfca16a6d5daf6a297ab9d99f07b2c27b56107266fe2cfdb0898688bfb67d43","observation_id":"b1b818aa-b07c-4c93-9dc7-786f9c5ae973","resolution":{"observed_at":"2026-07-02T07:06:43.608084Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2607.00937","last_updated":"2026-07-01T13:40:25Z","snapshot_observed_at":"2026-08-06T01:17:44.474757Z","submitted_at":"2026-07-01T13:40:25Z","title":"Persona Non Grata: LLM Persona-Driven Generations in MCQA are Unstable in Distinct Dimensions","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-07-02T13:06:28.163476Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.00937"},"observation_digest":"sha256:ed4fc4f8a177e1335ee558c37e18246d0aeb774b3458d429f8a94967f5d282df","observation_id":"72628e34-64c9-48b3-888c-2d2ed69436c4","resolution":{"observed_at":"2026-07-02T13:06:58.396919Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-12T01:10:52.578408Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03615","last_updated":"2026-07-10T17:26:34Z","snapshot_observed_at":"2026-08-08T06:36:15.479443Z","submitted_at":"2026-07-03T22:06:20Z","title":"The Powerless Noise: How Experimental Settings Shape the Reported Power of Noise","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-12T01:10:52.578408Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.03615"},"observation_digest":"sha256:05587065207f7a18693f514697371df365136541c2ae0a682bbf40a064b55b70","observation_id":"64b3a29c-8133-43ca-8f98-9fcec3499afc","resolution":{"observed_at":"2026-07-12T01:10:52.578408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-13T07:04:18.645464Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.03615","last_updated":"2026-07-10T17:26:34Z","snapshot_observed_at":"2026-08-08T06:36:15.479443Z","submitted_at":"2026-07-03T22:06:20Z","title":"The Powerless Noise: How Experimental Settings Shape the Reported Power of Noise","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-13T07:04:18.645464Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.03615"},"observation_digest":"sha256:c5e51eff8795e73c800aa00ecd637b2538cf2eec081225483d6c8918f1e5d9d7","observation_id":"6331b2e4-56c8-4ba6-82e6-43216ff0e9a5","resolution":{"observed_at":"2026-07-13T07:04:18.645464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":"2310.11324","doi":"10.1109/cdc57313.2025.11312997","metadata_source":"pith","pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":"cs.CL","work_id":"c3e484df-e654-4146-8c4e-a16ca850afc7","year":2023},"citing_paper":{"arxiv_id":"2607.07918","last_updated":"2026-07-08T21:03:27Z","snapshot_observed_at":"2026-08-12T12:28:45.728193Z","submitted_at":"2026-07-08T21:03:27Z","title":"Efficient Safety Alignment of Language Models via Latent Personality Traits","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-07-10T15:26:23.290009Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.07918"},"observation_digest":"sha256:165c2e703bb6cbedae49f473681f97287bbf5b878a0c26a4ed9113a1703697c5","observation_id":"e8aa52b9-50b7-4857-ba42-2e5c7aaf4568","resolution":{"observed_at":"2026-07-10T15:27:20.131028Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-14T19:17:45.652076Z","title":"https://ojs.aaai.org/ index.php/AAAI/article/view/6399","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.09665","last_updated":"2026-05-02T22:51:41Z","snapshot_observed_at":"2026-08-13T01:25:07.534510Z","submitted_at":"2026-05-02T22:51:41Z","title":"Format Sensitivity Index: Token-Controlled Prompt Wrapper Robustness and Schema Compliance in LLM Benchmarking","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T19:17:45.652076Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.09665"},"observation_digest":"sha256:cc924729a1c26c8dd35fefd35ca83a37175bb02f44cab5fc6cd7329a32952411","observation_id":"f939d13c-bfd1-46c4-a7d4-751fde27759e","resolution":{"observed_at":"2026-07-14T19:17:45.652076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-07-14T13:32:31.523845Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.10202","last_updated":"2026-08-08T06:29:00Z","snapshot_observed_at":"2026-08-15T02:38:54.736482Z","submitted_at":"2026-07-11T08:26:48Z","title":"When Counterbalancing Hides the Bias: Access-Conditioned Position Lock in Forced-Choice LLM Evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T13:32:31.523845Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.10202"},"observation_digest":"sha256:112a5efa6f912e76f7f156ad48b6fbdd2a588d17655a809708973df81c0a7130","observation_id":"1d107bd2-1d3c-4cd8-8594-ed31dca207d5","resolution":{"observed_at":"2026-07-14T13:32:31.523845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-01T23:59:51.912910Z","title":"Quantifying","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.15175","last_updated":"2026-07-16T16:23:56Z","snapshot_observed_at":"2026-08-12T15:07:27.200978Z","submitted_at":"2026-07-16T16:23:56Z","title":"Linear representations of grammaticality in neural language models","version":1},"reference_index":202,"source":"arxiv_source","source_observed_at":"2026-08-01T23:59:51.912910Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.15175"},"observation_digest":"sha256:a27017b26e91e844323bc6b9dc8bd913b540cca93b636a675f9e2750d1430db4","observation_id":"4252f286-08e7-4cb1-8455-ed83ca30c39f","resolution":{"observed_at":"2026-08-01T23:59:51.912910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-01T15:23:45.126518Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design, or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.18476","last_updated":"2026-07-20T19:47:16Z","snapshot_observed_at":"2026-08-12T15:06:32.786296Z","submitted_at":"2026-07-20T19:47:16Z","title":"Structured Output Collapses Answer Diversity Across 44 Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T15:23:45.126518Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.18476"},"observation_digest":"sha256:8623aa6240d4fb08016d64ba9832a3fae8ddc0f329a7bd8e85d5912131695292","observation_id":"e26db494-ebb4-4594-b5bd-f2c979823a99","resolution":{"observed_at":"2026-08-01T15:23:45.126518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-01T13:01:01.724152Z","title":"Yijun Yang, Zeyu Huang, Wenhao Zhu, Zihan Qiu, Fei Yuan, Jeff Z","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19257","last_updated":"2026-07-21T16:31:35Z","snapshot_observed_at":"2026-08-12T15:07:22.949709Z","submitted_at":"2026-07-21T16:31:35Z","title":"Prompt Design at Scale: How Format, Instruction Count, and Context Length Shape Instruction Adherence and Hallucination in Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T13:01:01.724152Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.19257"},"observation_digest":"sha256:024443b407b6ff1efb880cc853bb065fe5033f021483e17116a29651152c8179","observation_id":"8a6c7e48-a5a8-457c-95de-9d0822855397","resolution":{"observed_at":"2026-08-01T13:01:01.724152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-02T13:59:21.524288Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.20453","last_updated":"2026-05-14T20:03:14Z","snapshot_observed_at":"2026-08-12T15:06:34.798527Z","submitted_at":"2026-05-14T20:03:14Z","title":"A Knowledge-Injection Framework for Zero-Shot Adaptation of LLMs to Delirium Prediction","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T13:59:21.524288Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.20453"},"observation_digest":"sha256:acc1bc89961963e4662b37b8cff172edda65474d5e28bc8dcbeb6776eba6abba","observation_id":"0d850a5a-62e4-4273-8f1d-1f3e1059691d","resolution":{"observed_at":"2026-08-02T13:59:21.524288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-01T08:46:15.357112Z","title":"Quantifying Language Models’ Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.21010","last_updated":"2026-07-23T07:48:20Z","snapshot_observed_at":"2026-08-09T19:59:33.109243Z","submitted_at":"2026-07-23T07:48:20Z","title":"Reexamining zero-shot summarization: Empirical investigation of trustworthiness of LLM-summarizers","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T08:46:15.357112Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.21010"},"observation_digest":"sha256:1398af9410daa224c933b3678cb487105fd1a32e9bd890c8f1b1593625e7cf63","observation_id":"2d827d14-b1c1-4bd3-928a-5498c3224a70","resolution":{"observed_at":"2026-08-01T08:46:15.357112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-02T13:46:09.599956Z","title":"Sclar, Y","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.22554","last_updated":"2026-05-18T16:45:13Z","snapshot_observed_at":"2026-08-08T05:06:39.163957Z","submitted_at":"2026-05-18T16:45:13Z","title":"Same Question, Different Answers: Evaluating LLM Reliability Beyond Accuracy","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T13:46:09.599956Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2607.22554"},"observation_digest":"sha256:7299191b91fcef2dc6f0131f69ecb327f54fb7d46df28692aedf81a8ea0ed138","observation_id":"4b5a835c-c89d-4baa-bb83-3058e788e72b","resolution":{"observed_at":"2026-08-02T13:46:09.599956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-05T00:48:49.223511Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02665","last_updated":"2026-08-01T22:28:31Z","snapshot_observed_at":"2026-08-14T18:08:52.787563Z","submitted_at":"2026-08-01T22:28:31Z","title":"Single Canonical Prompts Underestimate LLM Safety's Surface-Form Sensitivity","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T00:48:49.223511Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.02665"},"observation_digest":"sha256:9e05eb374577c41f1451d9aaa77438a7b7cbb1cabf843540134b903856a88998","observation_id":"5c0b3f9e-5023-42cf-bfe0-6d65e5718c24","resolution":{"observed_at":"2026-08-05T00:48:49.223511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-07T13:40:15.005783Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06171","last_updated":"2026-08-06T15:37:04Z","snapshot_observed_at":"2026-08-12T13:51:50.496907Z","submitted_at":"2026-08-06T15:37:04Z","title":"Routing Is Least Learnable Where It Is Most Valuable: Bounds on Representation Routing for Web Agents","version":1},"reference_index":138,"source":"arxiv_source","source_observed_at":"2026-08-07T13:40:15.005783Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.06171"},"observation_digest":"sha256:c6176cf68364d0503182b0877911cff1a50c212dc6818fe2a753811aa486210f","observation_id":"7b8dfe7b-3e8f-4616-9f54-dc2a0ac0623b","resolution":{"observed_at":"2026-08-07T13:40:15.005783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-10T17:33:56.227086Z","title":"& Suhr, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06968","last_updated":"2026-08-07T08:44:20Z","snapshot_observed_at":"2026-08-13T23:03:41.041645Z","submitted_at":"2026-08-07T08:44:20Z","title":"Same physical state, different collective dynamics: state encodings select synchronization outcomes in language-model agents","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T17:33:56.227086Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.06968"},"observation_digest":"sha256:769af35bb10e531bb17a73a5221edd3dff101642db3fe6d5a24829f42a222430","observation_id":"bb688394-056d-41d5-aaf1-007eadd68b80","resolution":{"observed_at":"2026-08-10T17:33:56.227086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T00:52:42.047818Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.10385","last_updated":"2026-08-11T02:26:47Z","snapshot_observed_at":"2026-08-14T23:10:35.963652Z","submitted_at":"2026-08-11T02:26:47Z","title":"Persona Conditioning as an Assessor-Sensitivity Probe for LLM-Based IR Evaluation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-12T00:52:42.047818Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.10385"},"observation_digest":"sha256:4629b5d6895e4e7547dca4e43a0fd8c6362622a11dbc59c7ca5f9ebd2f5cd40c","observation_id":"bdbbb002-5899-4cc3-8b58-02836ac5f396","resolution":{"observed_at":"2026-08-12T00:52:42.047818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-12T06:04:17.071359Z","title":"Freda Shi, Mirac Suzgun, Markus Freitag, Xuezhi Wang, Suraj Srivats, Soroush Vosoughi, Hyung Won Chung, Yi Tay, Sebastian Ruder, Denny Zhou, Dipanjan Das, and Jason Wei","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.11110","last_updated":"2026-08-13T04:59:21Z","snapshot_observed_at":"2026-08-15T04:30:59.819470Z","submitted_at":"2026-08-11T16:18:34Z","title":"Actions Speak Louder than Words: Measuring Cross-Lingual Policy Retention in Tool-Using Agents","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-12T06:04:17.071359Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.11110"},"observation_digest":"sha256:3fc7b525f5fef43d0edd365b92b7b9da6aa9c625552d8dec8407d7fb5f18c939","observation_id":"6de43ecb-a9bc-44da-99b5-bed25974c9c2","resolution":{"observed_at":"2026-08-12T06:04:17.071359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11324","snapshot_observed_at":"2026-08-14T04:32:52.510712Z","title":"Jiaqi Shao, Hanck Chen, Wei Zhang, Maxm Pan, and Bing Luo","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.13547","last_updated":"2026-08-13T17:57:20Z","snapshot_observed_at":"2026-08-15T04:17:55.135198Z","submitted_at":"2026-08-13T17:57:20Z","title":"QuoteBench: How Matched Scores Can Hide Command-Path Failures","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-14T04:32:52.510712Z"},"links":{"cited_paper":"/paper/2310.11324","citing_paper":"/paper/2608.13547"},"observation_digest":"sha256:f9d32cec49c128341ac11f999007d9636fb0ee1f46ce6dd4164c4ae5866c600d","observation_id":"3bb96473-236a-497f-ba68-8dd57ed9a617","resolution":{"observed_at":"2026-08-14T04:32:52.510712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2310.11324/citation-record","integrity":"/paper/2310.11324/integrity","json":"/paper/2310.11324/citation-record.json","paper":"/paper/2310.11324"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1669084","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Tweet: Susan & I found MMLU performance jump 6-10 points in the 40s by formatting multiple choice as (A) not A in MMLU (for internal model)","venue":null,"work_id":"a98ef876-d539-4161-86fc-12ebf45c62ee","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:4cbdd1563b6d4469fdabe85cf0cc2a1bf2f66113eaf2fa55d8844bda3551447e","observation_id":"23c5f13b-058f-4f8b-97de-a2411d423f31","resolution":{"observed_at":"2026-05-17T01:59:51.394625Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Falcon-40B : an open large language model with state-of-the-art performance","venue":null,"work_id":"f87a57c8-47ba-4385-84be-df8a6ff868e2","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:e448eb9d9cd0880443df2ea8cea3a6e0ec77f9b875554134c8a2ddab88a4068b","observation_id":"956be0df-66bb-4914-a0db-8cd4e7b5039f","resolution":{"observed_at":"2026-05-17T01:59:51.501347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"An empirical evaluation of thompson sampling","venue":null,"work_id":"5267b456-570f-4cd0-ba11-51f07bd9cbae","year":2011},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:2ef8681fd095dfc9d5dba19f5a4baa2ba07fad481eee2fae2f0c43cff9112168","observation_id":"925bbcdb-d037-43c3-b065-71c87e4f4038","resolution":{"observed_at":"2026-05-17T01:59:51.503979Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Better hypothesis testing for statistical machine translation: Controlling for optimizer instability","venue":null,"work_id":"7574558d-bc86-480f-bb5e-f9809c19b113","year":2011},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:3490df45856896ebc0264e0d2898c89163ac6c5ff1571d38bff0bd5cfa30d6da","observation_id":"ba4e1fcf-f107-4b51-b6b3-062d01b12596","resolution":{"observed_at":"2026-05-17T01:59:51.506685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"GPT 3.int8(): 8-bit matrix multiplication for transformers at scale","venue":null,"work_id":"764578ef-94c9-44e1-88fc-c200bccc1f14","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:a5c3746f7f7bcc72a7d01332ef69cd2d6ea545fd6230a0a63392231f65b91c2f","observation_id":"88b0f953-5c8b-4220-9bcd-651eb1f61fe3","resolution":{"observed_at":"2026-05-17T01:59:51.509487Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Openprompt: An open-source framework for prompt-learning","venue":null,"work_id":"c533399d-21ac-408b-b9f8-5db14c803445","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:7647af87f9b81695f0739e81ccb48b12d36a48044184e519dd0401c2cf55d973","observation_id":"35fd58a4-464d-4701-b1f4-c35e5b1aa193","resolution":{"observed_at":"2026-05-17T01:59:51.512258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Measuring and improving consistency in pretrained language models","venue":null,"work_id":"36400b16-19bb-4f2a-9521-05047fdd2f1f","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:45f7967d8bfa1a43aade3612244b48c8b06491069a85b46b6f16df845aaecd7a","observation_id":"ef7a012f-8209-4e1e-935a-00baa84995a4","resolution":{"observed_at":"2026-05-17T01:59:51.515516Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep reinforcement learning that matters","venue":null,"work_id":"b66f80b3-15d3-4bb8-b54c-d7aaf5246258","year":2018},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:365b117106b7a299d2e7ee758750d4c2d052e9f4278eb380aa4254e2e7de9c94","observation_id":"c5b09f3e-1956-450c-8160-8942eb53edba","resolution":{"observed_at":"2026-05-17T01:59:51.519366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Editing models with task arithmetic","venue":null,"work_id":"c6905f5a-da2f-475c-a241-06748cc1c3a7","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:5d690900750cc8c31b9a51e0d1173ad465a30f8ffe2ef739b55dba76bfd972c2","observation_id":"6c7f1cdf-d166-42c1-980b-8e8b26b7cfe1","resolution":{"observed_at":"2026-05-17T01:59:51.523190Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"How can we know what language models know? Transactions of the Association for Computational Linguistics, 8: 0 423--438","venue":null,"work_id":"44712114-4ec4-44aa-9c87-382875c0d2b9","year":2020},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:84485debe9de3fbdf64d5bc0bb2ca66cc3d38bdbfb733863729b643a6eb8d453","observation_id":"efb1adda-a288-4065-a733-9ed2f4c65e3c","resolution":{"observed_at":"2026-05-17T01:59:51.526558Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Asymptotically efficient adaptive allocation rules","venue":null,"work_id":"3cb43574-be4b-454a-ab4c-cd36bbba724a","year":1985},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c7b11d4ec2e4220360e339ecd2a442c64a94cafbc88a5dea8dbabf282009c729","observation_id":"c17940ac-8712-49eb-9a48-df739b684ee4","resolution":{"observed_at":"2026-05-17T01:59:51.529807Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The power of scale for parameter-efficient prompt tuning","venue":null,"work_id":"0b35d7c3-0c21-4434-ba75-537e268630fa","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:85d318e0cb3955ae37c5702c4f3ec9c0e9e44baf5cdfcbe627fee28177b91e48","observation_id":"69a1127a-7e13-4c0a-badc-649939be276a","resolution":{"observed_at":"2026-05-17T01:59:51.533654Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":"89d10753-9978-4fc7-a069-2e5ae22a2447","year":2004},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:6dd0c6321ae5dd783f7805436508841fcbee16841ba5b35a65554503ecb94244","observation_id":"1b610d35-481b-4300-8abb-3812474c5d8d","resolution":{"observed_at":"2026-05-17T01:59:51.537693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"What makes chain-of-thought prompting effective? a counterfactual study","venue":null,"work_id":"cdb3532e-573a-41c3-8c8c-c96a63a81d89","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:decc7466d9fca7c9d71f3333dd4bf6d9057f27c6d816139c8e58718167a33376","observation_id":"1f5438eb-dfa8-414f-86d3-4f75dddc46a1","resolution":{"observed_at":"2026-05-17T01:59:51.541594Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Stereoset: Measuring stereotypical bias in pretrained language models","venue":null,"work_id":"017f826d-0e9d-4c0e-a25f-590c951097dd","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:628cfb87e56be3dd091bff5b38dccaffaaed14a18fe9e662ea6732b1ce0ce5e9","observation_id":"9e5056de-a469-4e7b-802e-28445a228263","resolution":{"observed_at":"2026-05-17T01:59:51.544935Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning how to ask: Querying lms with mixtures of soft prompts","venue":null,"work_id":"24bfcfd1-0c74-4040-bee5-18024bf6c828","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:b1be6d316910e1b7bf33e180ce29fb62950da46ff39d07d3076e888e17fc4bfb","observation_id":"67abd06c-7927-4565-bdc4-01521636eed4","resolution":{"observed_at":"2026-05-17T01:59:51.547957Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-diagnosis and self-debiasing: A proposal for reducing corpus-based bias in nlp","venue":null,"work_id":"9d5472cd-8773-4a52-87f2-1621d26955be","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:65488a0c86cdcf42603ab54eba891cf643303760fcd68b3b604e5f6bf803ce99","observation_id":"87eabb56-a08b-463f-84ba-6b8cc280e469","resolution":{"observed_at":"2026-05-17T01:59:51.551285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Chatgpt: Optimizing language models for dialogue","venue":null,"work_id":"3a5988c1-0b1c-4f73-8e6a-3b3e7cff650f","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c27a99d65b042ebe3a86f6d63360002704657d25ae9205bfbf39a74182a3a4fc","observation_id":"6bcac65a-229f-407b-a575-735fcb99ab1b","resolution":{"observed_at":"2026-05-17T01:59:51.554500Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":"fa13231c-4d75-41b9-a915-a7371e4bbace","year":2019},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:071ccb36cd3ce20127cd14be4fc0b533e342ee016371978b01428093d4320f08","observation_id":"ce4cb433-8914-4664-9e4b-0cd8553c6402","resolution":{"observed_at":"2026-05-17T01:59:51.557702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Large language models are human-level prompt engineers","venue":null,"work_id":"26a6e71e-97fd-4ca9-839f-812bf05f8a3e","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:32acf20f995fc237ff551813f29c4c1328ac84ac1832690f7aa98f5afb4b48d8","observation_id":"363ad71d-9efc-4221-a71f-71beafb4a411","resolution":{"observed_at":"2026-05-17T01:59:51.428661Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Findings of the Association for Computational Linguistics: EMNLP 2023 , pages=","venue":null,"work_id":"a2ed4e40-b24f-4239-aae6-c695fd9effea","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:b5b6b8e048d7a5d2ffe22cfcb708abccad3585db2f8349701dd52ee6ee55da3e","observation_id":"303e6923-59d2-4188-9afa-ecef67cd933b","resolution":{"observed_at":"2026-05-17T01:59:51.431448Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.804778Z","title":"Scaling Learning Algorithms Towards","venue":null,"work_id":"bb2761cc-98d0-411b-92f6-803773d64460","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:4e5f793a8a9bcc0c02869cb1ad8ce611ee4ddf39226073243331512ca5889ec6","observation_id":"ce95afe9-39b8-41aa-bf58-377ab12a4698","resolution":{"observed_at":"2026-05-17T01:59:51.434692Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T13:07:05.766846Z","title":"and Osindero, Simon and Teh, Yee Whye , journal =","venue":null,"work_id":"0a5921e3-ac4e-46f1-85ae-866119a87be0","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:db31182b0ea83208b054c6d696eaf9ece95bb0e4604107d3680802fbb8a88236","observation_id":"3fdc71a9-eb1c-48dd-9eaf-2490eeefec66","resolution":{"observed_at":"2026-05-17T01:59:51.437652Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T21:57:45.913036Z","title":"2016 , publisher=","venue":null,"work_id":"cf0899e0-53ee-4591-aae4-f38fa5ac12ad","year":2016},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:d586f0dc4025a45c1fc29ea5229f8645567a4b7589f6f2a898f440bda0aa494a","observation_id":"7cb0a65f-d2bb-4230-aa33-fabbc7b8dbdd","resolution":{"observed_at":"2026-05-17T01:59:51.440521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"9fa4d459-f2c1-4b56-ac89-b5e099311ae1","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:737079108f33c9d931a42bce8f82de8e230d325486cf0ac55a4f32c43268cb78","observation_id":"a894853f-7809-492e-8cc1-6e3d66184bc2","resolution":{"observed_at":"2026-05-17T01:59:51.443192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.340","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Super- N atural I nstructions: Generalization via declarative instructions on 1600+ NLP tasks","venue":null,"work_id":"2ff158b5-8900-4efa-8930-d26f842996ef","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:468297befad7345a71a41b0237cbd2467e75bc5bf018cdd3c6aca9bedf569975","observation_id":"adddd939-ed1f-43d7-af5e-356bd620117d","resolution":{"observed_at":"2026-05-17T01:59:51.384220Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":"2307.09288","doi":"10.24963/ijcai.2025/706","metadata_source":"pith","pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","venue":"cs.CL","work_id":"68a5177f-d644-44c1-bd4f-4e5278c22f5d","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:5cadf3c739cb973cf6e58fe72668acf7bda47c6b5ebfcb3d89bc61ca36dbb709","observation_id":"6d3acaeb-17d6-4dd3-89c7-43c915e926ea","resolution":{"observed_at":"2026-05-17T01:59:51.411132Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f590e03f-c81c-4105-99d7-9bab9660c453","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:240a2914906db4f60850258d151ee21b296d8315fabc0acf39a371a79b8ad85b","observation_id":"e7963705-ba5a-4820-af5b-668668322802","resolution":{"observed_at":"2026-05-17T01:59:51.445968Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.07830","last_updated":"2022-03-15T22:26:11Z","snapshot_observed_at":"2026-08-13T06:52:14.887194Z","submitted_at":"2021-09-16T09:44:43Z","title":"Reframing Instructional Prompts to GPTk's Language","version":3},"cited_work":{"arxiv_id":"2109.07830","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.07830","snapshot_observed_at":"2026-07-02T20:57:23.882331Z","title":"Reframing Instructional Prompts to GPTk’s Language, March 2022","venue":null,"work_id":"fd67f039-1b17-4966-b0ea-a207120cfb48","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2109.07830","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:1e323da5fd6b02d0b0a0f914f7e5a8e58e9e6cf243fbe156eca39cd18ef698c3","observation_id":"0fdbc677-f88c-4be8-8d5e-7376cb06b0cb","resolution":{"observed_at":"2026-05-17T01:59:51.407613Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"10faa75c-ff09-4e1b-ba47-3afebfd2114d","year":2020},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:1f39556b28aa86b02bece3e915b52048ebf1297f60390cd5702363bdfe9d3f07","observation_id":"0b22b42e-7e46-489c-b79e-0ab25d634b23","resolution":{"observed_at":"2026-05-17T01:59:51.449067Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.emnlp-main.346","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Wallace, Eric and Singh, Sameer","venue":null,"work_id":"ca9e4dcb-f559-41c7-9a93-3b9d6241a2fd","year":2020},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:f405ab1d1faf8c1776896a714fe0f7111bb7a230cd9de3d3cc77989913963fa3","observation_id":"4e1ed639-7176-459f-a20c-b2f7e260e0a3","resolution":{"observed_at":"2026-05-17T01:59:51.386958Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:29.483559+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:29.483559+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.emnlp-main.222","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RLP rompt: Optimizing Discrete Text Prompts with Reinforcement Learning","venue":null,"work_id":"9dfecfac-e6b7-40f2-a1c6-c49d8c3c0544","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:ec1a9c55a2284574525ca354dd2c9e874f65af4b246a98a1348bf0b0af45d924","observation_id":"9332d508-fd90-48aa-8f5c-5c72f609a9de","resolution":{"observed_at":"2026-05-17T01:59:51.361456Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-01T04:38:45.885595+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T04:38:45.885595+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.eacl-main.277","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"G r IPS : Gradient-free, Edit-based Instruction Search for Prompting Large Language Models","venue":null,"work_id":"02d2853c-742e-465d-bb6f-7199a3e03985","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c04fe375c962867db8f67fc364da8e659ba1228b375f786cc57abc65fdca4d61","observation_id":"2d1f930c-6029-4fd1-abd4-8bb73c703fcf","resolution":{"observed_at":"2026-05-17T01:59:51.367718Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-23T02:23:20.216414+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-23T02:23:20.216414+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10539","last_updated":"2022-12-20T18:47:13Z","snapshot_observed_at":"2026-08-13T20:06:52.695175Z","submitted_at":"2022-12-20T18:47:13Z","title":"Toward Human Readable Prompt Tuning: Kubrick's The Shining is a good movie, and a good prompt too?","version":1},"cited_work":{"arxiv_id":"2212.10539","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.10539","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"arXiv preprint arXiv:2212.10539 , year=","venue":null,"work_id":"aa61d06e-7785-4223-8a50-026b78a2d998","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2212.10539","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:29462bcc223bf1b219fe20bcc1f542574f493e09be6ea8521c33f71f0cab025a","observation_id":"684c532d-f3c3-412c-aee9-67edfa5e69c0","resolution":{"observed_at":"2026-05-17T01:59:51.425681Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T05:40:43.756350Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":"b5c09a7f-9766-462b-bf48-588e77738fb6","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:9141029173a4425b84f157fc420edfc34a4188a10781342e8425603bb1b998c2","observation_id":"7802663b-0457-45e6-aaf6-30dfdac66826","resolution":{"observed_at":"2026-05-17T01:59:51.452037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.03495","last_updated":"2023-10-19T04:37:25Z","snapshot_observed_at":"2026-08-13T11:49:15.736725Z","submitted_at":"2023-05-04T15:15:22Z","title":"Automatic Prompt Optimization with \"Gradient Descent\" and Beam Search","version":2},"cited_work":{"arxiv_id":"2305.03495","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2305.03495","snapshot_observed_at":"2026-07-04T18:40:03.102880Z","title":"Rafailov, R., Sharma, A., Mitchell, E., Ermon, S., Manning, C","venue":null,"work_id":"8f5910e5-bea1-4761-87ec-05f692dd6f04","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2305.03495","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:50e8dd8700157342554aea81cb4fa43417a04417a7dacb9d5dd1c5513cb9fefc","observation_id":"5ac2f298-efaf-462f-9ad2-c7d11eb7e95e","resolution":{"observed_at":"2026-05-17T01:59:51.390802Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T01:44:26.652447Z","title":"Text summarization branches out , pages=","venue":null,"work_id":"e24d1e5c-922a-45ee-b3bf-ea9055f2f8f3","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:d9d9306794424434ec93f3e742c7c29ba460e3bcdba51d98982185d7a7700a7e","observation_id":"cdd0a501-f844-4ed7-95e0-796f3a5ed4c0","resolution":{"observed_at":"2026-05-17T01:59:51.455527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T20:25:37.819483Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"1e48a0ba-4e64-4053-bace-7faecadb4ef9","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:ce322559fb55af7389f1466ab7b9ed979676ede5c3aebded18cb0a57fcaf8833","observation_id":"0db92237-9bae-4670-a5f5-a1837037446d","resolution":{"observed_at":"2026-05-17T01:59:51.458580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Eleventh International Conference on Learning Representations , year=","venue":null,"work_id":"b70ffc27-6f8a-41fd-b669-8c0c6297c846","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:d96a96903f0b036e028db8be9b14b88884db0875dff8be821ff49cbbef223b11","observation_id":"34689bb0-5418-4fde-b316-dc369ef0ed53","resolution":{"observed_at":"2026-05-17T01:59:51.461095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , url =","venue":null,"work_id":"772275a7-5d56-4537-be07-17dbb342dc9b","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:5bf981ccd0c18c8f22a0f93165d2adae301b05526aea1946971ef1e9bdde4cf2","observation_id":"7acd681a-a8bc-45a2-b6ed-a7c4ae282724","resolution":{"observed_at":"2026-05-17T01:59:51.463495Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , eprint=","venue":null,"work_id":"468ef9aa-e828-4adb-8aef-e1613f66b911","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:6308519e278b18c3999739c79308c05a049af1840686400ba6d797ce6e5cde28","observation_id":"3597a8de-b7d7-4221-bad5-b1edc0fab879","resolution":{"observed_at":"2026-05-17T01:59:51.465742Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.15043","last_updated":"2023-12-20T20:48:57Z","snapshot_observed_at":"2026-08-12T09:06:50.363435Z","submitted_at":"2023-07-27T17:49:12Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","version":2},"cited_work":{"arxiv_id":"2307.15043","doi":"10.48550/arxiv.2307.15043","metadata_source":"pith","pith_arxiv_id":"2307.15043","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Universal and Transferable Adversarial Attacks on Aligned Language Models","venue":"cs.CL","work_id":"3322fa86-1768-4677-8425-dd326b45e078","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2307.15043","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:f91c00bbd2b02139dc5687a0ca65407af2a9c4b2c6fc3ae009e53e4f0a15edcc","observation_id":"9079ed20-f698-4c86-9b07-489d1b1d3578","resolution":{"observed_at":"2026-05-17T01:59:51.414513Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-15T23:50:40.271168+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.02483","last_updated":"2023-07-05T17:58:10Z","snapshot_observed_at":"2026-08-08T18:11:45.725753Z","submitted_at":"2023-07-05T17:58:10Z","title":"Jailbroken: How Does LLM Safety Training Fail?","version":1},"cited_work":{"arxiv_id":"2307.02483","doi":"10.48550/arxiv.2307.02483","metadata_source":"pith","pith_arxiv_id":"2307.02483","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Jailbroken: How Does LLM Safety Training Fail?","venue":"cs.LG","work_id":"a0b5df13-7a81-4b15-afb4-c715e6b400bc","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2307.02483","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:182d590f566b785d2350be2a53424578bbeb6623608d618969a2300c7bd81e8d","observation_id":"4b9b33c4-422a-41a7-9277-514c541c5a89","resolution":{"observed_at":"2026-05-17T01:59:51.421696Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-22T21:23:25.377799+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2022 , url=","venue":null,"work_id":"19a3e5c0-b6a2-4e34-9622-de7121c8704a","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:ce6c247cf1eaef1140e27953bfeceb18276ee98b79196dd13127ed4a97a98c84","observation_id":"e0f1cf4c-2221-4853-9611-d9eee7638c10","resolution":{"observed_at":"2026-05-17T01:59:51.468076Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , volume=","venue":null,"work_id":"e75a2f93-45ce-4ef9-9a3d-bf310db97766","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c33e69aed1d0167d973f35d704f28a3151d50668023ffebb4fdd5431b2572254","observation_id":"b62c89cf-8186-4d10-b394-f6b6d82c0e14","resolution":{"observed_at":"2026-05-17T01:59:51.470604Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in applied mathematics , volume=","venue":null,"work_id":"0e8c7ba5-9cb2-4329-a92a-8584fe02d96c","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:174dffc1ded91702e1a499011fb8c12b099a0a1e6fceb444f2d78ddb7e0bc202","observation_id":"ed0459fa-53df-4574-84c7-53b74c5b28bc","resolution":{"observed_at":"2026-05-17T01:59:51.473063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.11382","last_updated":"2023-02-21T12:42:44Z","snapshot_observed_at":"2026-07-06T14:54:37.559648Z","submitted_at":"2023-02-21T12:42:44Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","version":1},"cited_work":{"arxiv_id":"2302.11382","doi":"10.48550/arxiv.2302.11382","metadata_source":"pith","pith_arxiv_id":"2302.11382","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"A Prompt Pattern Catalog to Enhance Prompt Engineering with ChatGPT","venue":"cs.SE","work_id":"8f6fdff2-0836-4403-b48b-be708927acc3","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2302.11382","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:22dcb129b32f4cc85fc42b237395781d5c793645bd470ba9cca137ae9fcf51cc","observation_id":"48b41ed1-527d-43bd-bf2c-c133a2a03a5d","resolution":{"observed_at":"2026-05-17T01:59:51.398030Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-05-24T00:53:36.117531+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-24T00:53:36.117531+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.acl-long.556","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity","venue":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Volume 1: Long Papers)","work_id":"731a7674-9850-4855-995a-4b938348fa34","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c1a490c660c3bad63b0da92258d34f6acdaec53644b7855f522d62c2eb3c71ec","observation_id":"79ef4430-c6ac-46b7-b90f-63670cb02eee","resolution":{"observed_at":"2026-05-17T01:59:51.377945Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-13T19:08:31.334755+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-13T19:08:31.334755+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.04037","last_updated":"2024-09-12T19:54:37Z","snapshot_observed_at":"2026-08-13T13:25:36.025760Z","submitted_at":"2022-12-08T02:21:47Z","title":"Demystifying Prompts in Language Models via Perplexity Estimation","version":2},"cited_work":{"arxiv_id":"2212.04037","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2212.04037","snapshot_observed_at":"2026-07-04T09:59:45.002855Z","title":"Demystifying prompts in language models via perplexity estimation","venue":null,"work_id":"e6af2d13-ea7c-4bf8-83b9-6b8e8729efcc","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/2212.04037","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:3216e78df9e4928878840d1cbdd9d5f529edea168f993eb498c86cf727bafdae","observation_id":"fa491dbd-8986-483e-8de1-53b530d9f23e","resolution":{"observed_at":"2026-05-17T01:59:51.403617Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2021.acl-long.295","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"doi: 10.18653/v1/2021.acl-long.295","venue":null,"work_id":"0052abb4-b8a1-4fff-8186-12b1cbf94dc7","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:403f2f676c0ae30a7fdaf334116f15b2aa82ab30ac524d5539355324246f8275","observation_id":"c09083b8-870b-4ffb-9aee-d26dcf3e37d7","resolution":{"observed_at":"2026-05-17T01:59:51.381003Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2023.acl-long.108","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"and Levy, Omer","venue":null,"work_id":"d3411c18-387a-4be7-ab85-546643d610e3","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:097ae4372e3402dfd2c9a94c9e139bdf19abd2434f73346edeb97c3f3ccc5363","observation_id":"f0463af4-f301-44b1-8e27-58c4ebc9fd6b","resolution":{"observed_at":"2026-05-17T01:59:51.370516Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"9672.293978","doi":"10.1145/2939672.293978","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Chen and C","venue":null,"work_id":"1c2af073-b162-4cd0-a5cd-d8aade23b9b5","year":2016},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:a8e537616a5c417f507a5e7bd95629252cec4c7b02439b4c981cac612a04888d","observation_id":"d7bd6c92-6451-4ae4-85c8-20ad0c8e3e11","resolution":{"observed_at":"2026-05-17T01:59:51.374277Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"93f83469-7da2-4dab-9080-d1c56613e670","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:a4ff82bf6ff09b9c0d7a507955960e530dd3b7d44e500fc827ddfd294a0b19cc","observation_id":"277fac3e-bce9-4b1f-bc44-e224a5b0c1be","resolution":{"observed_at":"2026-05-17T01:59:51.475332Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2021 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies (NAACL-HLT) , year=","venue":null,"work_id":"1fbd37da-e3aa-46ba-80d0-9828efeec283","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:26a9567d909cf857f90f7a8e22461cf48cdec99dae739b2b94eb2dbd10fd5bdb","observation_id":"6315a095-6442-4f59-8434-5c95ad579103","resolution":{"observed_at":"2026-05-17T01:59:51.477813Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics: System Demonstrations , pages=","venue":null,"work_id":"147ce949-9ad1-447d-8a0d-0135995632f7","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:c0e3f57f153218b48436edc52d31cd5de42c1bfd8fde6b0fdf16ecd4c9fcdbb8","observation_id":"63a03461-8ef6-4f3b-9801-72fd56b21afb","resolution":{"observed_at":"2026-05-17T01:59:51.480294Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"953df9ff-9a00-4a5d-8482-231ebf616393","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:2267f632c518f84ba69f06022be8fd65774310807e07d8a0f859b955dab5546b","observation_id":"f0fa1666-343a-4a81-94c1-afc124fdc093","resolution":{"observed_at":"2026-05-17T01:59:51.483065Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2022.naacl-main.266","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Prompt Waywardness: The Curious Case of Discretized Interpretation of Continuous Prompts","venue":"Proceedings of the 2022 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies","work_id":"60bfc21c-0b66-4d0b-8d1e-f7fe491cf270","year":2022},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:f8a892e01491866f379c7495b117ae56d905c7342a17d4c0b53a79f44c0ba5c4","observation_id":"06807b0d-c111-442f-9c49-bfc1f1dca216","resolution":{"observed_at":"2026-05-17T01:59:51.365010Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2021 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"c6ff9969-befc-412c-a057-e9748d634a1e","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:6685f8ca3f3e40fc237b1e725d239d2080ed25197335dbd95dec4bc9f7a98c9f","observation_id":"ac4ccb65-6b8b-41a3-83d2-722b6f0c8d2b","resolution":{"observed_at":"2026-05-17T01:59:51.485685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 49th Annual Meeting of the Association for Computational Linguistics: Human Language Technologies , pages=","venue":null,"work_id":"b7de5011-31f9-4a32-96cb-ebf25788a91a","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:97a87fe586f3812edcfa9fa791a5a703d75b1d22f590dc9cb3caaaee4a237ba2","observation_id":"5cda8762-5e00-4b05-bfa4-73a7a1c30a49","resolution":{"observed_at":"2026-05-17T01:59:51.488168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.04133","last_updated":"2017-08-10T19:20:15Z","snapshot_observed_at":"2026-08-15T03:09:17.358218Z","submitted_at":"2017-08-10T19:20:15Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","version":1},"cited_work":{"arxiv_id":"1708.04133","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.04133","snapshot_observed_at":"2026-07-03T00:07:28.185044Z","title":"Reproducibility of Benchmarked Deep Reinforcement Learning Tasks for Continuous Control","venue":"cs.LG","work_id":"79bc5b68-7f90-4779-aa0d-5e000bdf6421","year":2017},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"cited_paper":"/paper/1708.04133","citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:d57945621b35fc097464082c1a873baef4e7a260384621bea2101cb81a7437dd","observation_id":"62ee2e47-b803-4397-ae12-dfa2aa8d5498","resolution":{"observed_at":"2026-05-17T01:59:51.418148Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"OpenAI blog , year=","venue":null,"work_id":"92c55c0b-1d07-4b9a-9540-749c5e3c1b66","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:420deed4538c1be66028efbc8e5da652519001fbd480d80f3c4c05c96759f12c","observation_id":"90da363f-d2d8-4b37-b585-cfe12678bc2a","resolution":{"observed_at":"2026-05-17T01:59:51.490490Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transactions of the Association for Computational Linguistics , volume=","venue":null,"work_id":"300b3739-f346-4c58-930f-0a2cdafad50a","year":2021},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:6932fd358c63164a2b45278aa26e487ac91355d9157d3c472f36b194f643aaa0","observation_id":"79f94082-5c5e-4783-a0f5-42fabe4a2263","resolution":{"observed_at":"2026-05-17T01:59:51.492948Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T08:00:47.057113Z","title":"Proceedings of the AAAI conference on artificial intelligence , volume=","venue":null,"work_id":"882ea053-89d5-41bc-9e13-e4b4d4cc4a20","year":null},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:93222c976558365cb39b0b1c0ba102ce0ec60ebeab71fe630fa24a1cbfda7ee5","observation_id":"1d185803-b062-4568-92b2-ee65b70b3a8a","resolution":{"observed_at":"2026-05-17T01:59:51.495994Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2023 , booktitle=","venue":null,"work_id":"4fc8bfd7-aab1-49b3-a9f2-963074e6e35c","year":2023},"citing_paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting","version":2},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-17T01:59:51.326493Z"},"links":{"citing_paper":"/paper/2310.11324"},"observation_digest":"sha256:7156ce0fee599f20c181b5b6a30df2778c5d21edf9f599ee167756198dbcea2b","observation_id":"017a4e09-2529-4a05-a318-df7e76e82b77","resolution":{"observed_at":"2026-05-17T01:59:51.498435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-14T06:32:32.682623+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2310.11324","last_updated":"2024-07-01T22:28:01Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T15:05:30.306144Z","submitted_at":"2023-10-17T15:03:30Z","title":"Quantifying Language Models' Sensitivity to Spurious Features in Prompt Design or: How I learned to start worrying about prompt formatting"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":9,"parse_uncertain":0,"unresolved":2,"verified_exact":10,"verified_fuzzy":43},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-14T06:32:32.682623+00:00","source":"crossref"},{"observed_at":"2026-08-14T06:32:18.44784+00:00","source":"retraction_watch"}],"thesis":"As of 15 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 96 inbound Pith citation observations for arXiv:2310.11324."}