{"as_of":"2026-08-09T09:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:391a4d98192c0ff21cc9aff533562124871ecf324c6a0d2499f1ed7c4f75f25e","coverage":[{"denominator":68,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":68,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T01:52:39.537911Z","state":"measured"},{"denominator":68,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":68,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.23424/citation-record","integrity":"/paper/2607.23424/integrity","json":"/paper/2607.23424/citation-record.json","paper":"/paper/2607.23424"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:30.777132Z","title":"and Koller, Alexander , title =","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:30.777132Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:c6c261d72802a98bd92bdaf72a4e0a713f6240d27920f614ea2b1831da1cd7c3","observation_id":"53d7c1c6-c526-40fc-a291-4f065e9eabbb","resolution":{"observed_at":"2026-08-03T01:52:30.777132Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:30.895551Z","title":", title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:30.895551Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:64bdb04c4263fde17b165ad82a04c36955c765c8807c1ede22f6b4acc6d56440","observation_id":"0b962acd-44fa-4d3e-ae56-cd9e8df7e72b","resolution":{"observed_at":"2026-08-03T01:52:30.895551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.056397Z","title":"On the Measure of Intelligence , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.056397Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:121727555eb996fcf22f0d14871e01e0c646e0744e2bf88ad7a8bcb93b05c868","observation_id":"e43a6ede-d5f6-441e-b3a0-2ee5ae701bfe","resolution":{"observed_at":"2026-08-03T01:52:31.056397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-03T01:52:31.123316Z","title":"arXiv preprint arXiv:2110.14168 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.123316Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:ca19d748f318680cf4c34c167234fa9e5a916c1158c060f33baa0e6f344b0b92","observation_id":"e431649d-ab78-4409-98f4-79e8e69f2cb5","resolution":{"observed_at":"2026-08-03T01:52:31.123316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.281717Z","title":"Proceedings of the 2024 Conference of the North American Chapter of the Association for Computational Linguistics (","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.281717Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:db2f451ed30eca0fb8f7855d265584f6fc1e799609975d5aafdd816240406ba8","observation_id":"fce46e46-45e8-4b56-af38-f4650936ff21","resolution":{"observed_at":"2026-08-03T01:52:31.281717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.450750Z","title":"and Sanyal, Soumya and Welleck, Sean and Ren, Xiang and Ettinger, Allyson and Harchaoui, Zaid and Choi, Yejin , title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.450750Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:94d84a8d9110d092b1884f2146fa6382a8405c05e681a77425c3a14473fa0be6","observation_id":"c39f1a42-4bb2-4ea0-9482-4964c093f329","resolution":{"observed_at":"2026-08-03T01:52:31.450750Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.564827Z","title":"Science , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.564827Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:0d0e9e1e2568f65ba791144f060d10d68e61d535fafe315d0176b9eeeeda1d98","observation_id":"5efe27d5-2b6b-429d-a51f-3a4644d5dd3e","resolution":{"observed_at":"2026-08-03T01:52:31.564827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.664929Z","title":"Journal of Economic Perspectives , volume =","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.664929Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:15df719ad095b92d5f1445335edbb15bd4939381972a5335316961d936aca329","observation_id":"a0f57b6f-7f7d-49d7-98fa-93262c77163e","resolution":{"observed_at":"2026-08-03T01:52:31.664929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.788144Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.788144Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:a6d8b8b3470b735f537614feadc8f94293d43ea9416cf9227d2e16653e1e5eaa","observation_id":"5361eee2-729e-4312-aa2b-fbb5afc439c8","resolution":{"observed_at":"2026-08-03T01:52:31.788144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.891822Z","title":"Nature Communications , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.891822Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:06eee00720a793ef3efacceee31545535222f50afe7261908daf07edd4114195","observation_id":"3482ef73-863d-40af-a016-c862093b2f17","resolution":{"observed_at":"2026-08-03T01:52:31.891822Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:31.980987Z","title":"Nature , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:31.980987Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:a94250c8bf6570a73d5c5d48942be2ccc61b104ca366e95c00530fd0cb8b31b2","observation_id":"0f03253f-82cf-4a3e-9b72-768c338d23bb","resolution":{"observed_at":"2026-08-03T01:52:31.980987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.071794Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.071794Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:457ef948092d115c1ef70193d759f78c43bda102f43e9fb99a8631ae03f1742e","observation_id":"7127cc3a-c9cd-41fa-a77c-73021f8b4200","resolution":{"observed_at":"2026-08-03T01:52:32.071794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.210929Z","title":"Proceedings of the International Conference on Learning Representations (","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.210929Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:0f9203158bfcd3683efa9b40f27b5fe0107f372142dc99496c871c86ad0cfc52","observation_id":"56836794-af5b-4a2d-8f8f-3b738833caaa","resolution":{"observed_at":"2026-08-03T01:52:32.210929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-03T01:52:32.390179Z","title":"arXiv preprint arXiv:2207.05221 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.390179Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:f52c124c5467d5af70cf6a2085e4c868b8ff24a5b63f6decb0c38a17ae5c7073","observation_id":"b3cde208-cf72-440a-bfb4-a273edc78fb6","resolution":{"observed_at":"2026-08-03T01:52:32.390179Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.452772Z","title":"Econometrica , volume =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.452772Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:7746da5419bed148df8c067d5cb7351f71f9839b8bfb5b39035af362fb0d22dc","observation_id":"8edf8a44-06c1-4ccb-bd56-3d672134fa9d","resolution":{"observed_at":"2026-08-03T01:52:32.452772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.545990Z","title":"2022 , howpublished =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.545990Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8d751a2b6557b0337c5ccd301052b4dda827dd24112fec44ab5739eb1a8fc52d","observation_id":"51cd0dd9-47a2-48b8-beab-af403a15571f","resolution":{"observed_at":"2026-08-03T01:52:32.545990Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.652424Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.652424Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8247246f2e188c77c9c4003b6995d2ae575bba95b2df031873bf4b39db02e1e1","observation_id":"66b71eca-8948-4d1a-9c79-98d3a2b35902","resolution":{"observed_at":"2026-08-03T01:52:32.652424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:32.770474Z","title":"and Mattar, Marcelo G","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.770474Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:e71aa215e5aba6a90bd75de54038c6f7d060a3f83a5bc3fafe04e2604a15d01a","observation_id":"2537e85b-c44d-458d-8fcd-97064a1fbd81","resolution":{"observed_at":"2026-08-03T01:52:32.770474Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.14334","last_updated":"2022-06-13T05:04:53Z","snapshot_observed_at":"2026-08-03T04:20:54.522222Z","submitted_at":"2022-05-28T05:02:31Z","title":"Teaching Models to Express Their Uncertainty in Words","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.14334","snapshot_observed_at":"2026-08-03T01:52:32.950854Z","title":"arXiv preprint arXiv:2205.14334 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:32.950854Z"},"links":{"cited_paper":"/paper/2205.14334","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:6ab1042f3ecd9f927f45a452dfa4729c351a29860f1463fe909d79e8eae9ea91","observation_id":"de382ddf-9b25-4cd0-98ee-f50ed58215d0","resolution":{"observed_at":"2026-08-03T01:52:32.950854Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:33.264121Z","title":"Signs of Introspection in Large Language Models , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:33.264121Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:717cf586fafacaca46ec6bd7a478fd10b7119e441eed238fc811cedcefe004e2","observation_id":"021b5d66-d9df-491e-816c-740057d2bd06","resolution":{"observed_at":"2026-08-03T01:52:33.264121Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.076162Z","title":"Proceedings of the 60th Annual Meeting of the Association for Computational Linguistics (Short Papers) , pages =","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.076162Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:17d03a890a0a4f110c721865d7bf035203433eb0ec0e314a3ab9f1fa3791df63","observation_id":"11eed839-72ee-4a4a-b670-5fde9525809e","resolution":{"observed_at":"2026-08-03T01:52:34.076162Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.197903Z","title":"2026 , url =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.197903Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:a71f1c28d083802cb6f56a55a7e95826cb30c172b3d986f637017cb1f606cff8","observation_id":"23295262-6d70-4243-b3a2-39112d9b3559","resolution":{"observed_at":"2026-08-03T01:52:34.197903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-03T01:52:34.266734Z","title":"arXiv preprint arXiv:2410.05229 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.266734Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:f16bd6f3f4f206411616c7f071ec80eaedb5a94073a75cab18d9defdbc5a0984","observation_id":"a4933e1e-d4c1-46d8-8f3a-6b43ee6ece55","resolution":{"observed_at":"2026-08-03T01:52:34.266734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.349212Z","title":"2024 , howpublished =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.349212Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:6417a1c0f2fe262cb74ef0135286df239e935d3e2bf157a030bbd80ea923fc7b","observation_id":"bdcdea39-8d09-48d2-8937-3eb2bf6df50e","resolution":{"observed_at":"2026-08-03T01:52:34.349212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-03T01:52:34.438153Z","title":"arXiv preprint arXiv:2501.14249 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.438153Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:a2b6a5277672e4b055b9060275a8e2b43e4503046d5a8618bd96b4c3edd2f535","observation_id":"289de811-07d2-4845-8184-e5f4ef95e63a","resolution":{"observed_at":"2026-08-03T01:52:34.438153Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.503349Z","title":"Advances in Neural Information Processing Systems (","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.503349Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:fce4ed4fd9516ef0e8f48e0e02506ba75674dbe6ca6ad0a2b7d2f58810a2208c","observation_id":"44fb4da6-d128-47d1-bfc9-045d600a958d","resolution":{"observed_at":"2026-08-03T01:52:34.503349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12022","last_updated":"2023-11-20T18:57:34Z","snapshot_observed_at":"2026-08-04T22:55:15.345443Z","submitted_at":"2023-11-20T18:57:34Z","title":"GPQA: A Graduate-Level Google-Proof Q&A Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12022","snapshot_observed_at":"2026-08-03T01:52:34.584926Z","title":", title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.584926Z"},"links":{"cited_paper":"/paper/2311.12022","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:d7e24458422c6a06aba3c26fa6afa9b7e1371860793863c4f8507b32e6c40f76","observation_id":"8c0b2a8d-e0d1-4822-a39c-2ae9e25cee84","resolution":{"observed_at":"2026-08-03T01:52:34.584926Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.646893Z","title":"ACM Computing Surveys , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.646893Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:01d1e6cf7c965fd84763c000d5ecab5e7543572159896f666e13030782531083","observation_id":"8b6ff639-6d13-47d4-9764-b2b057cb1ccb","resolution":{"observed_at":"2026-08-03T01:52:34.646893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.721339Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.721339Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:9ba3b0fc1fc87775fc5f72918de0c8d472baef814a4b1ee32ceeb9af1021de7c","observation_id":"5d43a52b-7263-45e2-a381-c691643b1b8b","resolution":{"observed_at":"2026-08-03T01:52:34.721339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.793327Z","title":"Nature Machine Intelligence , volume =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.793327Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:b732caeb5880d67f7312564a3004db9205ced138782b70c1acac6cbc15db9ebe","observation_id":"fcc919a8-fb3e-4c2b-81da-bcbc8345a6fa","resolution":{"observed_at":"2026-08-03T01:52:34.793327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.868568Z","title":", title =","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.868568Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:95f7c0cf0319e6fed25689d5ce7a755020420e1560f916b49f63ba8aff2e18af","observation_id":"eb23ba69-f029-441f-904c-5e52ebf04498","resolution":{"observed_at":"2026-08-03T01:52:34.868568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:34.955646Z","title":"and Chi, Ed H","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:34.955646Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:eae6371127e379a16e86982a701a82bbe19c3d65a67d313a5009a283123937eb","observation_id":"203407d2-827b-48d0-9cc9-eeb02eded45a","resolution":{"observed_at":"2026-08-03T01:52:34.955646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.048324Z","title":"and Le, Quoc V","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.048324Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:226dcbf2229f802ba5bdf5f172ca8655e8a0f960c2134744edb12eef117778e2","observation_id":"66e3d788-6106-4ccb-bcf2-281d602c2c9e","resolution":{"observed_at":"2026-08-03T01:52:35.048324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.122339Z","title":"and Zhang, Hao and Gonzalez, Joseph E","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.122339Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:22d36a4e885b63c09bf93dd5757e536c5bf7a07e555292ddcaa6ed72acb4ef15","observation_id":"0b548f0d-6076-4630-8456-b0899cf02407","resolution":{"observed_at":"2026-08-03T01:52:35.122339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.237793Z","title":", title =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.237793Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8f5dfad15289de6099cb54e760c15a68a3e2b96125f1f477e075f26ab034d2df","observation_id":"787ddf63-7006-4241-87c0-482455a0cc4a","resolution":{"observed_at":"2026-08-03T01:52:35.237793Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.358142Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.358142Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:06d729620e48a92d922f593a3a026fd71595c999f4e26677599b77ca2008f86f","observation_id":"afb3f337-2411-425c-a915-e1df960fd737","resolution":{"observed_at":"2026-08-03T01:52:35.358142Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.439778Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.439778Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:5f9463e8b1218883a775a414d5c0e9fe1c35fabe1bb9d46481ef85bc59431e2b","observation_id":"973cf21d-329b-4e6f-a99c-52a1f80cfda4","resolution":{"observed_at":"2026-08-03T01:52:35.439778Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.496930Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.496930Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:eb2c36728160dae65bfb5799567bfa00dd60e9a281097b71e0f517844f63996d","observation_id":"0ce0f9ef-3168-4b7d-b55e-aaa3c1d3dbae","resolution":{"observed_at":"2026-08-03T01:52:35.496930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.561194Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.561194Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8cf83e61653c1e3cfc1d1cbc55cb3cf6a2d56bae3b0165e411993eaae31a9829","observation_id":"f3caac84-fecf-4ba7-801a-75ff0da8bbfc","resolution":{"observed_at":"2026-08-03T01:52:35.561194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.701977Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.701977Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:6f158c31b2643a8f8603687e2b03a39df3bfe272a9c59fff19139339d304fd9e","observation_id":"6e222749-a2d7-4642-a308-ed66f308f788","resolution":{"observed_at":"2026-08-03T01:52:35.701977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.811050Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.811050Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:7c193d53967520aa9c95eaeebddacf5a464e4487e98165721040495a3356db2d","observation_id":"e5599b30-fa9b-438d-86fc-51a5685b3863","resolution":{"observed_at":"2026-08-03T01:52:35.811050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:35.914432Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:35.914432Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:9e836dbd1415abf2d868b56d8be0e00f4e0c99975dee4c87352a09320d4903bb","observation_id":"711337a2-66c4-4805-bed2-3c6edf326737","resolution":{"observed_at":"2026-08-03T01:52:35.914432Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:36.050669Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:36.050669Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:3a26fae6684fcded884080c2902b4343cfb1e84d8c2a780b066394fe1aacde44","observation_id":"18d0140d-d905-4ebc-a58a-5e5a0f6459de","resolution":{"observed_at":"2026-08-03T01:52:36.050669Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:36.219590Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:36.219590Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:76cd3e17a09de3679397bdd47234b44cb43c62d6196461dd4c5daac62fee31da","observation_id":"d9edb498-de77-4570-87c3-4156565d3bce","resolution":{"observed_at":"2026-08-03T01:52:36.219590Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04069","last_updated":"2024-10-03T13:51:53Z","snapshot_observed_at":"2026-08-09T00:13:53.804763Z","submitted_at":"2024-07-04T17:15:37Z","title":"A Systematic Survey and Critical Review on Evaluating Large Language Models: Challenges, Limitations, and Recommendations","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04069","snapshot_observed_at":"2026-08-03T01:52:36.422818Z","title":"arXiv preprint arXiv:2407.04069 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:36.422818Z"},"links":{"cited_paper":"/paper/2407.04069","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:ca3ebc865260760485448b2b052e0dca995c06dbd640bb764eff41f92d265bc8","observation_id":"8e922e85-cd6f-4873-b52d-406981569fe1","resolution":{"observed_at":"2026-08-03T01:52:36.422818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:36.645066Z","title":"Leak, Cheat, Repeat: Data Contamination and Evaluation Malpractices in Closed-Source","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:36.645066Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:054061496137e4416ffe3de0f6c0ad01d9c23498a1cf0e0a6532352516ff0bfe","observation_id":"0f1b62ca-50d5-43ab-8aab-8effd189aeb1","resolution":{"observed_at":"2026-08-03T01:52:36.645066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:36.834724Z","title":"Under review at the Conference on Neural Information Processing Systems (","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:36.834724Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:eb4b68f1e945cc9b3333f81a211a750b68f1f23184bec90b416d5637b846d366","observation_id":"1842d8d1-f3e0-4ae4-a98a-46847901ff36","resolution":{"observed_at":"2026-08-03T01:52:36.834724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:37.011206Z","title":"Under review at the Conference on Neural Information Processing Systems (","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.011206Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:829026441b30113cd72f2127a7264fbb718679c6efb7e0a3fabcbfd9182e62fb","observation_id":"919ba264-5e42-456d-a322-b274d8ff5519","resolution":{"observed_at":"2026-08-03T01:52:37.011206Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:37.185402Z","title":"2026 , howpublished =","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.185402Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:61f55eff9d1fab1d04cd3e7c448e51c6486cb2216cd8b7de7721dc9b975b1399","observation_id":"dca2a8f6-5a98-47fb-b21c-5b667d933578","resolution":{"observed_at":"2026-08-03T01:52:37.185402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:37.354922Z","title":", title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.354922Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8b94304087adf4d450a30677e7efcf15c78bd33b7e843a9c938065266df1d7f1","observation_id":"814d3347-95ee-4005-a781-16634476b7a3","resolution":{"observed_at":"2026-08-03T01:52:37.354922Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:37.532163Z","title":"2025 , howpublished =","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.532163Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:64ac5fd7a5160549f07f2cc5e2082ac8235ef6d3ecefaf3b62169978f4362a88","observation_id":"01a06d24-b6a8-432f-a977-6b6a24fa1e92","resolution":{"observed_at":"2026-08-03T01:52:37.532163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:37.703844Z","title":"Demystifying Evals for","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.703844Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:c233f968a95dc67124dd330aef4a9b0df5eba62561f7bb6b806a98ac120b2c2c","observation_id":"16c079bb-9cd4-4efb-b1b5-784854d421a6","resolution":{"observed_at":"2026-08-03T01:52:37.703844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.04667","last_updated":"2025-04-02T15:17:02Z","snapshot_observed_at":"2026-07-06T18:58:35.218405Z","submitted_at":"2024-08-06T16:43:35Z","title":"Non-Determinism of \"Deterministic\" LLM Settings","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.04667","snapshot_observed_at":"2026-08-03T01:52:37.877568Z","title":"and Radcliffe, Evan and Rajagopal, Guru Rajan and Sloan, Adam and Tudrej, Tomasz and Ture, Ferhan and Wu, Zhe and Xu, Lixinyu and Baldwin, Breck , title =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:37.877568Z"},"links":{"cited_paper":"/paper/2408.04667","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:8fa0727649a8ab80719038efda1c59d615de0324efebb4d618b745bf8ecf8fc3","observation_id":"620c1444-7cc2-43cc-90e6-837520eb1902","resolution":{"observed_at":"2026-08-03T01:52:37.877568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.14782","last_updated":"2026-05-31T00:04:33Z","snapshot_observed_at":"2026-08-07T18:21:12.072228Z","submitted_at":"2024-05-23T16:50:49Z","title":"Lessons from the Trenches on Reproducible Evaluation of Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.14782","snapshot_observed_at":"2026-08-03T01:52:38.010434Z","title":"arXiv preprint arXiv:2405.14782 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.010434Z"},"links":{"cited_paper":"/paper/2405.14782","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:7ab8e12e43ffccdd9c6d203fe825dfae43bd5034b11cc53cd05a8175a48c53af","observation_id":"91eafecd-9e9b-4145-b519-59935db38d29","resolution":{"observed_at":"2026-08-03T01:52:38.010434Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.125205Z","title":"Harvard Data Science Review , volume =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.125205Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:919e7b1e7816e939dbbba64111339b1765d19099c38dd8af4814b2f8e904d4a5","observation_id":"ec2ee305-a281-42e4-9266-1b5562d67813","resolution":{"observed_at":"2026-08-03T01:52:38.125205Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.238415Z","title":"and Shadbolt, Nigel and Wooldridge, Michael , title =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.238415Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:933be98e88a0e73eb096bda0c60989c9769f0a8f8b681c062bdf6a97b30cb92f","observation_id":"a51b2060-474c-4a69-bb04-df485ca02fb1","resolution":{"observed_at":"2026-08-03T01:52:38.238415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.378314Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.378314Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:a49e20833611389055b7569467744d2a18a460401138841449f03e991bb2614e","observation_id":"9ecd8478-39d6-41ae-b8de-1fa797804320","resolution":{"observed_at":"2026-08-03T01:52:38.378314Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.482684Z","title":"Advances in Neural Information Processing Systems (NeurIPS) , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.482684Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:10536cfe7046a12cc78a14f80bd97aa2ed5af1c021d5411885b3fe701bb66c0f","observation_id":"0ce81c40-df7a-49c1-a620-40d579af684b","resolution":{"observed_at":"2026-08-03T01:52:38.482684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11020","last_updated":"2024-06-16T17:26:44Z","snapshot_observed_at":"2026-07-06T18:31:49.437336Z","submitted_at":"2024-06-16T17:26:44Z","title":"RUPBench: Benchmarking Reasoning Under Perturbations for Robustness Evaluation in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11020","snapshot_observed_at":"2026-08-03T01:52:38.577316Z","title":"arXiv preprint arXiv:2406.11020 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.577316Z"},"links":{"cited_paper":"/paper/2406.11020","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:19c13743ca975cf2c59331e763d4373344a3d8a1b563688ba4818056601ef274","observation_id":"b58994f9-d4e6-4c6d-94d9-884a55ac8053","resolution":{"observed_at":"2026-08-03T01:52:38.577316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.01167","last_updated":"2025-05-21T02:06:29Z","snapshot_observed_at":"2026-08-08T15:10:53.628960Z","submitted_at":"2025-04-01T20:14:35Z","title":"Predicting Field Experiments with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.01167","snapshot_observed_at":"2026-08-03T01:52:38.675850Z","title":"arXiv preprint arXiv:2504.01167 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.675850Z"},"links":{"cited_paper":"/paper/2504.01167","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:5f4751232a221d756d944f7739f9b39d4f33c12d6bb2e7183ea77ceb2cd35a78","observation_id":"76ce866d-aa48-4128-a08d-659f11f587e1","resolution":{"observed_at":"2026-08-03T01:52:38.675850Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.765456Z","title":"and Filippas, Apostolos and Manning, Benjamin S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.765456Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:e8d8540a3d19c1bd20725413572841cf2a6748b7d0cde7ea628604d5a6603fec","observation_id":"86aefb9d-4b72-4670-b299-411f3574a6c3","resolution":{"observed_at":"2026-08-03T01:52:38.765456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.09686","last_updated":"2025-01-23T08:44:44Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-16T17:37:58Z","title":"Towards Large Reasoning Models: A Survey of Reinforced Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.09686","snapshot_observed_at":"2026-08-03T01:52:38.881421Z","title":"arXiv preprint arXiv:2501.09686 , year =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.881421Z"},"links":{"cited_paper":"/paper/2501.09686","citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:fd8081e326c8da4ff2a1517c55d418922cf89e51b6a3b7b2c1586f6907b8f8c3","observation_id":"63fcdc09-e9fa-47f1-8d6c-9ad8e7730295","resolution":{"observed_at":"2026-08-03T01:52:38.881421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:38.991560Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:38.991560Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:f9965e9486617b4ea947a7e5bceaf7cf015e8d1d7a597aa8c9e89cb7be35ae30","observation_id":"63cc99c0-4a64-4789-a286-6eb2c7edf790","resolution":{"observed_at":"2026-08-03T01:52:38.991560Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:39.063427Z","title":null,"venue":null,"work_id":null,"year":2013},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:39.063427Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:5b4cb700349e920d1cf11dca6e74a9a987fdd88acc655b9c666b9f376db4461a","observation_id":"0eef6998-8d7e-4de0-904f-541275b7f43b","resolution":{"observed_at":"2026-08-03T01:52:39.063427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:39.172176Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:39.172176Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:ca265d320dd6a6525839ab77e204d8237f76f60ec736ceacf5198134d4245de5","observation_id":"8282ba3e-5779-4fbe-a09f-78f07d9e208d","resolution":{"observed_at":"2026-08-03T01:52:39.172176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:39.283087Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:39.283087Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:e8dcc8dc97b879d73ec2c0a3dcb605ac4874abe5c6c38200e1bc83cc56cb7e6f","observation_id":"f007cc00-b260-4503-a156-54dead6b51d3","resolution":{"observed_at":"2026-08-03T01:52:39.283087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:39.389172Z","title":"2024 , note =","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:39.389172Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:cd5fa479017755430f2864764d22699ad85a9ef1e31aa924b840d2b0e145cfc3","observation_id":"480467a5-b531-42a8-86e1-e32020887170","resolution":{"observed_at":"2026-08-03T01:52:39.389172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T01:52:39.537911Z","title":"and Gonczarowski, Yannai A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-03T01:52:39.537911Z"},"links":{"citing_paper":"/paper/2607.23424"},"observation_digest":"sha256:2ecd46bc54edd0a565ecb074ebe0268a134560c77797c5605614ec3ba1e0b378","observation_id":"df4bc0f9-5e7c-49dc-b6b1-44699b29ad6c","resolution":{"observed_at":"2026-08-03T01:52:39.537911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.23424","last_updated":"2026-07-31T07:03:49Z","latest_version":3,"primary_category":"econ.GN","snapshot_observed_at":"2026-08-08T16:00:24.265612Z","submitted_at":"2026-07-26T02:46:04Z","title":"Wrong and More Confident: A Field Experiment on Large Language Models Taking a Graduate Economics Exam"},"reference_resolution":{"displayed":68,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":67,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":68},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 68 of 68 outbound references and 0 inbound Pith citation observations for arXiv:2607.23424."}