{"as_of":"2026-08-09T03:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:115080e2e6a67b84e196428acc540c06c33a7668d03a1ac4b12aaad64896e0da","coverage":[{"denominator":41,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":41,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T14:42:46.895939Z","state":"measured"},{"denominator":42,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":42,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T03:19:00.468509Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.14109","snapshot_observed_at":"2026-07-31T03:19:00.468509Z","title":"Simplicity paradox: Debunking myths about prompting and datasets for llm evaluation.arXiv preprint arXiv:2607.14109, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.28576","last_updated":"2026-07-30T17:38:23Z","snapshot_observed_at":"2026-08-03T07:46:35.369681Z","submitted_at":"2026-07-30T17:38:23Z","title":"Sample More, Reflect Less: Self-Refine and Reflexion Lose to Repeated Sampling at Equal Token Cost, from 1.5B to 7B","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T03:19:00.468509Z"},"links":{"cited_paper":"/paper/2607.14109","citing_paper":"/paper/2607.28576"},"observation_digest":"sha256:076b8c2f0d06c5c6a05a2f736a02bd9dc2131035125013c2d3933dc84d6ee792","observation_id":"c09d33ea-403f-4738-85b1-ac4435c38fb5","resolution":{"observed_at":"2026-07-31T03:19:00.468509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.14109/citation-record","integrity":"/paper/2607.14109/integrity","json":"/paper/2607.14109/citation-record.json","paper":"/paper/2607.14109"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:43.688759Z","title":"Matharena: Evaluating llms on uncontaminated math competitions, February 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:43.688759Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:8dcf602cea2889732a10de9647401f5223f01ac63ef99545ec8cd0acddf7a3d7","observation_id":"a8dbedc3-b580-44a4-a9ac-7ad770bbecec","resolution":{"observed_at":"2026-08-02T14:42:43.688759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-07-06T08:34:41.399203Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-02T14:42:43.736195Z","title":"On the measure of intelligence.arXiv preprint arXiv:1911.01547, 2019","venue":null,"work_id":null,"year":1911},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:43.736195Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:af8d6f330efa264f29a28e60c30f3a831856ecdd29b67e3d9561961b0b5f5af2","observation_id":"8d12022a-c777-4faa-b2d7-cf6bc25524cd","resolution":{"observed_at":"2026-08-02T14:42:43.736195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03278","last_updated":"2025-06-03T18:05:10Z","snapshot_observed_at":"2026-08-08T06:32:28.175857Z","submitted_at":"2025-06-03T18:05:10Z","title":"FailureSensorIQ: A Multi-Choice QA Dataset for Understanding Sensor Relationships and Failure Modes","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.03278","snapshot_observed_at":"2026-08-02T14:42:43.792576Z","title":"Failuresensoriq: A multi-choice qa dataset for understanding sensor relationships and failure modes, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:43.792576Z"},"links":{"cited_paper":"/paper/2506.03278","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:f6f3122b8165e130e6da124e043fae014bc4d1684879680026b1b5a63c38dad5","observation_id":"417d6c12-b74f-4a4b-a868-83dfde7673f4","resolution":{"observed_at":"2026-08-02T14:42:43.792576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-02T14:42:43.868953Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:43.868953Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:4af1dbb364fff3823422a7962780ef2ed366c977a166e571968c980d29ca0be6","observation_id":"62de648b-6cab-427d-b068-09919e94592c","resolution":{"observed_at":"2026-08-02T14:42:43.868953Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:43.942648Z","title":"The language model evaluation harness, July 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:43.942648Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:9db8938a80b6a838315963564f448afa3e67e254fd4ee516ed2683bd20c40840","observation_id":"c81abba5-3dd0-4b90-8299-695c12f88f6d","resolution":{"observed_at":"2026-08-02T14:42:43.942648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-02T14:42:44.008058Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.008058Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:27b4981efb9f131e73c39f96bf1bff8bf68bd868dfb730bc9ff31a3bc5ed65a6","observation_id":"3fa92299-6cb3-4ee8-9aa2-6f6e55ec04e1","resolution":{"observed_at":"2026-08-02T14:42:44.008058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.077828Z","title":"What disease does this patient have? a large-scale open domain question answering dataset from medical exams.Applied Sciences, 11(14):6421, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.077828Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:ed17cd6089d6024665d98ce182eca1b439795bfebddc8db8c95e0bb9cd17988a","observation_id":"07c789f4-03fc-4bae-a2b9-ce5bbcb66dd4","resolution":{"observed_at":"2026-08-02T14:42:44.077828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.125291Z","title":"Dynabench: Rethinking benchmarking in NLP","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.125291Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:eb1c77ade9fa3aad08a32ee73b05ff155fffdd04e59852c30d6d55c700a62645","observation_id":"6a17f4d5-65a3-4b16-8856-0ccc80f9cbde","resolution":{"observed_at":"2026-08-02T14:42:44.125291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.201129Z","title":"Large language models are zero-shot reasoners.Advances in Neural Information Processing Systems, 35:22199–22213, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.201129Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:35e7dd41addac25d6d590586cce1bd5311cf6f36878e9843998d0c81ea7f2561","observation_id":"6da2fbb5-5677-4a57-80d3-639352a73d76","resolution":{"observed_at":"2026-08-02T14:42:44.201129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01875","last_updated":"2025-06-28T18:42:47Z","snapshot_observed_at":"2026-08-08T00:13:14.578726Z","submitted_at":"2025-02-26T13:47:13Z","title":"Time-MQA: Time Series Multi-Task Question Answering with Context Enhancement","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01875","snapshot_observed_at":"2026-08-02T14:42:44.258314Z","title":"Time-mqa: Time series multi-task question answering with context enhancement, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.258314Z"},"links":{"cited_paper":"/paper/2503.01875","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:669b86dfd1f80a7210e5dc765a7f80316cca663a6547a3f736a450e35e16479f","observation_id":"b665a6cf-375d-462c-b5ac-a24d556037b0","resolution":{"observed_at":"2026-08-02T14:42:44.258314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.341417Z","title":"Prompt repetition improves non-reasoning llms.arXiv preprint arXiv:2512.14982, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.341417Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:95bde37522ca31cb2ccc3f560fd4b844cb2d0a14fc0b312cc76be426703ba343","observation_id":"0f54f492-b7ab-455a-bc1f-b81c96cb9f13","resolution":{"observed_at":"2026-08-02T14:42:44.341417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.09110","last_updated":"2023-10-01T21:44:23Z","snapshot_observed_at":"2026-08-01T19:14:56.803459Z","submitted_at":"2022-11-16T18:51:34Z","title":"Holistic Evaluation of Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.09110","snapshot_observed_at":"2026-08-02T14:42:44.399738Z","title":"Holistic evaluation of language models.arXiv preprint arXiv:2211.09110, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.399738Z"},"links":{"cited_paper":"/paper/2211.09110","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:51295d80891e7abdf34c3597046c4cc653a0844f5ee2847a4b3d24f84584f00e","observation_id":"41a00ded-0a6b-4172-bbf1-76b0eeb0c10c","resolution":{"observed_at":"2026-08-02T14:42:44.399738Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.484533Z","title":"Fantastically ordered prompts and where to find them: Overcoming few-shot prompt order sensitivity","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.484533Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:d5c2d463d96c09b999dea992cab3165be8805232fdf71337e0b4a0ec46a1e017","observation_id":"dd81da62-65e4-44e3-9d57-0260c64f53c7","resolution":{"observed_at":"2026-08-02T14:42:44.484533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14739","last_updated":"2025-03-28T15:21:44Z","snapshot_observed_at":"2026-07-29T21:41:16.650188Z","submitted_at":"2025-02-20T17:05:58Z","title":"SuperGPQA: Scaling LLM Evaluation across 285 Graduate Disciplines","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14739","snapshot_observed_at":"2026-08-02T14:42:44.560800Z","title":"SuperGPQA: Scaling llm evaluation across 285 graduate disciplines","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.560800Z"},"links":{"cited_paper":"/paper/2502.14739","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:01e9baf4196bcb479a6a09fb60ebd6dbcc047bfa6e83df4f4e5644e2b58143ce","observation_id":"bbd846b0-2b40-4227-8ff3-1ac792f89aa5","resolution":{"observed_at":"2026-08-02T14:42:44.560800Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09880","last_updated":"2024-10-14T02:11:29Z","snapshot_observed_at":"2026-08-05T15:21:23.913810Z","submitted_at":"2024-02-15T11:08:10Z","title":"Inadequacies of Large Language Model Benchmarks in the Era of Generative Artificial Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09880","snapshot_observed_at":"2026-08-02T14:42:44.631644Z","title":"McIntosh, Teo Susnjak, Tong Liu, Paul Watters, and Malka N","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.631644Z"},"links":{"cited_paper":"/paper/2402.09880","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:2b52aacd93989afd5f0cbc7e3a3b4793c5264c70f7b67ce8616da541989295bf","observation_id":"0c9c93e9-8fc0-4bda-a6c1-b5b050d53f65","resolution":{"observed_at":"2026-08-02T14:42:44.631644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.690538Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.690538Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:fb52bdcda08f6a4ecf01713cd5f27715bdfdc65dd045f33b0c3e505024d5f3c5","observation_id":"bc0dad1d-790a-46e4-9562-e30006943550","resolution":{"observed_at":"2026-08-02T14:42:44.690538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.771497Z","title":"State of what art? a call for multi-prompt LLM evaluation.Transactions of the Association for Computational Linguistics, 12:933–949, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.771497Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:46ea152b3a28b4aa753a36d816cc1b00fed7e83b389f69c439738e4774eb88ef","observation_id":"bbe22d41-b35b-4b96-bfe4-2711edc2c830","resolution":{"observed_at":"2026-08-02T14:42:44.771497Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-02T14:42:44.851388Z","title":"s1: Simple test-time scaling.arXiv preprint arXiv:2501.19393, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.851388Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:ed10d716d49b44d25d62f8d1709fc3e6da5557ff84bc6cb33debce5c7f49e6ee","observation_id":"2b98c736-2e7d-4f91-81f7-65991303bab1","resolution":{"observed_at":"2026-08-02T14:42:44.851388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.933675Z","title":"Large language models sensitivity to the order of options in multiple-choice questions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.933675Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:61e3285b54ff51d718ad4555c4c0a38c5fe4aebd357be18c306cca384338a76d","observation_id":"803145ac-f648-4d8e-b804-397b5d9d61b3","resolution":{"observed_at":"2026-08-02T14:42:44.933675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:44.989333Z","title":"Smith, and Mike Lewis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:44.989333Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:a0965bc63486d662939b97548aa3c43babf9d311c0aee3fcb7a437fbf581aacb","observation_id":"7a2d1432-7497-4207-8d26-67b65e837ee8","resolution":{"observed_at":"2026-08-02T14:42:44.989333Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-02T14:42:45.058968Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.058968Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:731dc0f936734dcee472bbb1ff6de4cc0b72ef07c8beb7590cf9c3998b200613","observation_id":"08c60252-8d51-437c-9a79-752328250936","resolution":{"observed_at":"2026-08-02T14:42:45.058968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-02T14:42:45.126365Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.126365Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:f7962a7400b9438166697f87288d6a240c426b6119e0aa7c0d5274c4b086881f","observation_id":"ae5a0261-8753-4e0f-a714-525fe8aca56c","resolution":{"observed_at":"2026-08-02T14:42:45.126365Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.188960Z","title":"Leveraging large language models for multiple choice question answering","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.188960Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:aae140c6b47606196ef16e9caeb6a3db68581db70caf9aad7a7a40e261193c2b","observation_id":"4208621a-99dc-462f-ae7b-af01e99f96ee","resolution":{"observed_at":"2026-08-02T14:42:45.188960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.271611Z","title":"Rogers, Inna Goncearenco, Giuseppe Sarli, Igor Galynker, Denis Peskoff, Marine Carpuat, Jules White, Shyamal Anadkat, Alexander Hoyle, and Philip Resnik","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.271611Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:8434cc665b2884f10526f45f7e61f292ce3d3a572bcd4ad9498c5792ee740b83","observation_id":"d90898b8-5376-45d0-bd23-cfc1466a0610","resolution":{"observed_at":"2026-08-02T14:42:45.271611Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.351262Z","title":"Quantifying language models’ sensitivity to spurious features in prompt design or: How i learned to start worrying about prompt formatting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.351262Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:6f92721ee3e5218529cec9d33c0e1d563d34b7c163359325707ff53c4c18136f","observation_id":"69da3077-c6af-40d9-8c9b-e370aff58097","resolution":{"observed_at":"2026-08-02T14:42:45.351262Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.03314","last_updated":"2024-08-06T17:35:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-06T17:35:05Z","title":"Scaling LLM Test-Time Compute Optimally can be More Effective than Scaling Model Parameters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.03314","snapshot_observed_at":"2026-08-02T14:42:45.427128Z","title":"Scaling llm test-time compute optimally can be more effective than scaling model parameters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.427128Z"},"links":{"cited_paper":"/paper/2408.03314","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:1822a674ff80ab0291f0d3d1f7352dc05973ea53afa714efa7b8c898ba47ed3f","observation_id":"3c9b5ff5-58b6-40e5-9167-4b6ec5955431","resolution":{"observed_at":"2026-08-02T14:42:45.427128Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12183","last_updated":"2025-05-07T18:00:45Z","snapshot_observed_at":"2026-08-01T16:38:42.947080Z","submitted_at":"2024-09-18T17:55:00Z","title":"To CoT or not to CoT? Chain-of-thought helps mainly on math and symbolic reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12183","snapshot_observed_at":"2026-08-02T14:42:45.567640Z","title":"To CoT or not to CoT? chain- of-thought helps mainly on math and symbolic reasoning.arXiv preprint arXiv:2409.12183, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.567640Z"},"links":{"cited_paper":"/paper/2409.12183","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:e197979e0300fdb64b7dfefba6087b20f6b370fe985e8a998d7a9ae80c0d6514","observation_id":"386a2a21-f5f9-4ae0-9201-d03189116cb1","resolution":{"observed_at":"2026-08-02T14:42:45.567640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-02T14:42:45.737278Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, et al","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.737278Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:d5b932f10fab545ba77addc45adca8ae1acbddf4abe2334a7f365df61a154a6a","observation_id":"070c18b0-ffd7-407a-a68b-274a9e4b9031","resolution":{"observed_at":"2026-08-02T14:42:45.737278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.811194Z","title":"On the self-verification limitations of large language models on reasoning and planning tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.811194Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:fb25116f10390d4b1d897982cba1896b45d61528fff46778d3bb4f8e571683fc","observation_id":"c24b6286-216d-48e8-a2b9-698aee799855","resolution":{"observed_at":"2026-08-02T14:42:45.811194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.891639Z","title":"Correctbench: A benchmark of self-correction in llms","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.891639Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:c2fbca1fc8aef67a0a760ce3376942c39086e76041cb1c56d63190868d01f9be","observation_id":"a086f0a8-0857-4400-b802-8181fd1b6235","resolution":{"observed_at":"2026-08-02T14:42:45.891639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:45.950957Z","title":"Plan-and-solve prompting: Improving zero-shot chain-of-thought reasoning by large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:45.950957Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:348177f13d435981bb2f5b71032f670544a103a0105b84efe4714a8e209c6a51","observation_id":"7869f54f-2d87-4e95-bf18-6242d863dbc3","resolution":{"observed_at":"2026-08-02T14:42:45.950957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.11171","last_updated":"2023-03-07T17:57:37Z","snapshot_observed_at":"2026-07-06T12:50:22.773056Z","submitted_at":"2022-03-21T17:48:52Z","title":"Self-Consistency Improves Chain of Thought Reasoning in Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.11171","snapshot_observed_at":"2026-08-02T14:42:46.034794Z","title":"Self-consistency improves chain of thought reasoning in language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.034794Z"},"links":{"cited_paper":"/paper/2203.11171","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:b6024cfabb91d6441e22eabbb3d650f0a004ce77faa1e873304a6309998c7ed9","observation_id":"5d944d42-32fc-4147-8eba-f70080c55be0","resolution":{"observed_at":"2026-08-02T14:42:46.034794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.01574","last_updated":"2024-11-06T02:54:00Z","snapshot_observed_at":"2026-08-06T00:29:17.674418Z","submitted_at":"2024-06-03T17:53:00Z","title":"MMLU-Pro: A More Robust and Challenging Multi-Task Language Understanding Benchmark","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.01574","snapshot_observed_at":"2026-08-02T14:42:46.087335Z","title":"Mmlu-pro: A more robust and challenging multi-task language understanding benchmark.arXiv preprint arXiv:2406.01574, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.087335Z"},"links":{"cited_paper":"/paper/2406.01574","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:257452c27d95dae290b21b481f18207eb2d9be88a4640a4869f73d6f8137d9ef","observation_id":"7ba8a91c-af99-4941-8964-d5d2feba3625","resolution":{"observed_at":"2026-08-02T14:42:46.087335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.157373Z","title":"Chain-of-thought prompting elicits reasoning in large language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.157373Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:82ae2dcf7d5f3f0e977085bd15b26df07cb611c96e10d3ab55f98e616a8c1f92","observation_id":"435a630f-28ab-479a-9174-543f4c4ada6f","resolution":{"observed_at":"2026-08-02T14:42:46.157373Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.222619Z","title":"Griffiths, Yuan Cao, and Karthik Narasimhan","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.222619Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:1380e40fe86c65b9e0c37a618ba3cbc3336b98f0aa5b14b7bf6226ff340f7bba","observation_id":"fe702455-6e0e-495a-b1e9-bc7d265db053","resolution":{"observed_at":"2026-08-02T14:42:46.222619Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.344230Z","title":"Chi, and Denny Zhou","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.344230Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:45443a3a3113c93348c44702c863bff3027694eff544ed4fcf333bc027bc66a1","observation_id":"1a961236-da12-45fd-bd23-b8616d05477b","resolution":{"observed_at":"2026-08-02T14:42:46.344230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10063","last_updated":"2023-01-25T18:57:59Z","snapshot_observed_at":"2026-07-06T13:54:33.476578Z","submitted_at":"2022-09-21T01:30:59Z","title":"Generate rather than Retrieve: Large Language Models are Strong Context Generators","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10063","snapshot_observed_at":"2026-08-02T14:42:46.446916Z","title":"Generate rather than retrieve: Large language models are strong context generators.arXiv preprint arXiv:2209.10063, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.446916Z"},"links":{"cited_paper":"/paper/2209.10063","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:11bd9ee497aa2567beeec1fc94423d10f96ab928a5ce96faeb619e2e1fa00be7","observation_id":"4ef20845-7303-4fc7-b64f-855a71505425","resolution":{"observed_at":"2026-08-02T14:42:46.446916Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.560399Z","title":"Large language models are not robust multiple choice selectors","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.560399Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:9baa359a2e3d6bd2c52bcf69f19a94f2e45e570b3856ac2a3ce548bf2617ddbd","observation_id":"dfa6988e-f120-447c-9960-8645380e31a3","resolution":{"observed_at":"2026-08-02T14:42:46.560399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.668559Z","title":"Scaling physical reasoning with the physics dataset, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.668559Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:6592d12e4f40ff0a5343fcc44aa69085bb224f891c8a2758a825f7a276d0bfca","observation_id":"14d137af-1c5b-4983-ba1d-0cb7b9eb896b","resolution":{"observed_at":"2026-08-02T14:42:46.668559Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.07910","last_updated":"2024-08-20T00:28:45Z","snapshot_observed_at":"2026-08-05T04:16:54.399572Z","submitted_at":"2023-12-13T05:58:34Z","title":"PromptBench: A Unified Library for Evaluation of Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.07910","snapshot_observed_at":"2026-08-02T14:42:46.785295Z","title":"PromptBench: A unified library for evaluation of large language models.Journal of Machine Learning Research, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.785295Z"},"links":{"cited_paper":"/paper/2312.07910","citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:b0a1c27c3b05d1965f90c8c068580cef3b7591d32905a24964c7c2c1368d5880","observation_id":"ab524a00-2979-4d1d-8413-3f01fdfb7fa5","resolution":{"observed_at":"2026-08-02T14:42:46.785295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T14:42:46.895939Z","title":"Avg. opt","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T14:42:46.895939Z"},"links":{"citing_paper":"/paper/2607.14109"},"observation_digest":"sha256:4ac50dad6406cbe6847d315d53b9b73c4aaf910140cad3f10f603d831d27d7f9","observation_id":"0f23936f-5148-4702-9339-0d8f554e1d0b","resolution":{"observed_at":"2026-08-02T14:42:46.895939Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14109","last_updated":"2026-05-07T21:11:51Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-08T06:32:48.904917Z","submitted_at":"2026-05-07T21:11:51Z","title":"Simplicity Paradox: Debunking myths about prompting and datasets for LLM evaluation"},"reference_resolution":{"displayed":41,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":40,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":41},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 41 of 41 outbound references and 1 inbound Pith citation observation for arXiv:2607.14109."}