{"as_of":"2026-08-07T20:59:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3323b8ef649a26524e476447360ff4ed49a62714016585894ed60bc5e9db745c","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:03:13.238164Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":9,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":9,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T14:22:31.301050Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T14:48:32.596036Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-08-06T14:22:31.301050Z","title":"Pitfalls in evaluating language model forecasters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.19477","last_updated":"2025-07-25T17:59:13Z","snapshot_observed_at":"2026-08-06T14:22:15.971521Z","submitted_at":"2025-07-25T17:59:13Z","title":"Advancing Event Forecasting through Massive Training of Large Language Models: Challenges, Solutions, and Broader Impacts","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T14:22:31.301050Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2507.19477"},"observation_digest":"sha256:9fe269b3c4db44c868fd4d775120a4244d338e5d022390c406c5527607f9b955","observation_id":"ea63d7ae-fdf2-44c3-a6f4-daf17c074fd1","resolution":{"observed_at":"2026-08-06T14:22:31.301050Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2604.18576","last_updated":"2026-07-12T18:34:47Z","snapshot_observed_at":"2026-07-16T23:18:42.403825Z","submitted_at":"2026-04-20T17:57:51Z","title":"Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T04:14:17.395227Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2604.18576"},"observation_digest":"sha256:a525059c077aac86b5e06e7c9f872cc3170b61fa46f64fe093042cb49c67268e","observation_id":"dc9bdf19-a263-4c7d-ace7-a5a1d7382167","resolution":{"observed_at":"2026-05-11T12:06:01.790093Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-14T19:33:20.775008Z","title":"Pitfalls in evaluating language model forecasters","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2604.18576","last_updated":"2026-07-12T18:34:47Z","snapshot_observed_at":"2026-07-16T23:18:42.403825Z","submitted_at":"2026-04-20T17:57:51Z","title":"Agentic Forecasting using Sequential Bayesian Updating of Linguistic Beliefs","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-07-14T19:33:20.775008Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2604.18576"},"observation_digest":"sha256:8bfb5ecf37930a0eb1ad39e06a621e80bdc7ae47b411a1fb259aa797354b9e61","observation_id":"d7b565c1-5342-4cde-8ccc-302464aeda7e","resolution":{"observed_at":"2026-07-14T19:33:20.775008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.03762","last_updated":"2026-05-05T13:50:50Z","snapshot_observed_at":"2026-07-06T23:16:40.201701Z","submitted_at":"2026-05-05T13:50:50Z","title":"OracleProto: A Reproducible Framework for Benchmarking LLM Native Forecasting via Knowledge Cutoff and Temporal Masking","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-07T16:29:51.187292Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.03762"},"observation_digest":"sha256:6a4459719b3eefc45df27f6e62bb5a91b8b3f615707c614e8148788911c597c7","observation_id":"4fddfe23-5ead-4288-9c8b-e0e9468a9566","resolution":{"observed_at":"2026-05-11T23:41:16.852549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.22672","last_updated":"2026-05-22T17:57:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:33Z","title":"Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-22T05:24:10.513564Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.22672"},"observation_digest":"sha256:2f1206c762dda8cf9a8d26b145b9b406d91aadf0030bb7a450cc15dd90626cc5","observation_id":"581b2b62-0eb3-4eb6-8def-1f9932c4e0ac","resolution":{"observed_at":"2026-05-22T05:24:38.182496Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2605.22672","last_updated":"2026-05-22T17:57:26Z","snapshot_observed_at":"2026-07-06T23:32:59.663926Z","submitted_at":"2026-05-21T16:14:33Z","title":"Is Capability a Liability? More Capable Language Models Make Worse Forecasts When It Matters Most","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-25T06:04:28.277835Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2605.22672"},"observation_digest":"sha256:10d89972376a0e5439cc042b1037a58573e8c6225549fa7472525e3bec64114b","observation_id":"1308da45-df6a-4fa8-9541-48f021f3391b","resolution":{"observed_at":"2026-05-25T06:05:26.173990Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2607.00164","last_updated":"2026-06-30T20:42:45Z","snapshot_observed_at":"2026-08-04T14:45:57.113312Z","submitted_at":"2026-06-30T20:42:45Z","title":"Verifiable Rewards for Calibrated Probabilistic Forecasting","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-02T19:45:23.721172Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.00164"},"observation_digest":"sha256:66e60d82c7b79e901963cf0e728db7cac94eaf61f6521614010ff27a03fe2d17","observation_id":"96a2d95c-533a-408f-a97b-695b4234adc6","resolution":{"observed_at":"2026-07-02T19:47:18.746566Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":"2506.00723","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-03T14:48:32.596036Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":"5d924817-147c-440e-bbc1-864738b1fab5","year":2025},"citing_paper":{"arxiv_id":"2607.01661","last_updated":"2026-07-02T03:41:25Z","snapshot_observed_at":"2026-07-07T00:07:13.555571Z","submitted_at":"2026-07-02T03:41:25Z","title":"Diverse Evidence, Better Forecasts: Multi-Agent Deliberation Under Information Asymmetry","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-07-03T14:40:49.038578Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.01661"},"observation_digest":"sha256:ed08080c250d03b189fee0391c66ac774ccd1fccbab65e9e5b1acc78af4786c5","observation_id":"f722227c-1417-4514-a413-5aff1b4cdb29","resolution":{"observed_at":"2026-07-03T14:48:32.597385Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.00723","snapshot_observed_at":"2026-07-14T14:36:29.370385Z","title":"arXiv preprint arXiv:2506.00723 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.09921","last_updated":"2026-07-10T19:16:03Z","snapshot_observed_at":"2026-08-03T11:44:21.404736Z","submitted_at":"2026-07-10T19:16:03Z","title":"Global Merger-Arbitrage Forecasting with Language Models","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-07-14T14:36:29.370385Z"},"links":{"cited_paper":"/paper/2506.00723","citing_paper":"/paper/2607.09921"},"observation_digest":"sha256:2839caa5be1fffb21e9c7ea654a1841abf0e205cf11dac84525b7bb1398c852b","observation_id":"7af55740-3045-4809-8594-c92e94661666","resolution":{"observed_at":"2026-07-14T14:36:29.370385Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.00723/citation-record","integrity":"/paper/2506.00723/integrity","json":"/paper/2506.00723/citation-record.json","paper":"/paper/2506.00723"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.554671Z","title":"Who predicted 2022?, 2023","venue":null,"work_id":"21939ff1-ffce-46b3-a1ca-b1d90f693814","year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.622895Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:018f4562813665e69d97de8196143f75a4a27a252d3bb5e1882ad6d2eccaa154","observation_id":"be73dd28-81e0-42a8-8dc8-e01252230a94","resolution":{"observed_at":"2026-08-07T12:03:17.610428Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.424248Z","title":"A backtesting protocol in the era of machine learning","venue":null,"work_id":"65403674-84e0-45c0-a4e5-7bb92ea51d10","year":2018},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.696705Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:6850266004509440d0ad16776846c0114f94cc3926dd77f8ffe313b5fc8d4ac4","observation_id":"15730f2b-f060-411c-b62f-2c89ace57b7b","resolution":{"observed_at":"2026-08-07T12:03:17.485240Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.297517Z","title":"The probability of backtest overfitting","venue":null,"work_id":"89338270-e691-4da1-b366-0257b61228f6","year":2015},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.739151Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:917abca859ec45e1f727904d91cbe964a76881a1ccd9c1d0637e52d3614f1f07","observation_id":"ce37d9e5-8aa5-4eec-9649-fe766e973ef4","resolution":{"observed_at":"2026-08-07T12:03:17.360878Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.160319Z","title":"Contra papers claiming superhuman AI forecasting, 2024","venue":null,"work_id":"d29f94a6-66b6-4800-80eb-6d7d471a53f8","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.846511Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:197c66450cdc13145ad03fc9499f7f143900624f499d518f0ca603371669ea25","observation_id":"c33d3321-55c5-4d0e-8c73-437e02d93db8","resolution":{"observed_at":"2026-08-07T12:03:17.233335Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:17.015580Z","title":"Long-horizon predictability: a cautionary tale","venue":null,"work_id":"109143ff-7788-4490-85fb-5209a2b60a09","year":2019},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.927181Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:1208b7bb2afcbaa2296c8b2477ce5dc9d9d1bb89833e75c1377010d8245d325e","observation_id":"de7a0767-3adf-40c2-a02e-3b53253eb1c4","resolution":{"observed_at":"2026-08-07T12:03:17.071504Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.863238Z","title":"AI forecasting bots incoming: comment section, 2024","venue":null,"work_id":"7a325743-7189-4833-bb56-cb839a448a20","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:09.989448Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:3e3c02aeec019d57e6716031dbff7415fff191269abd402360bf858277184be0","observation_id":"4c3f244a-ed12-4e92-89a0-e1d1596abd4e","resolution":{"observed_at":"2026-08-07T12:03:16.940861Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.739191Z","title":"Point-in-time vs","venue":null,"work_id":"c51d307f-e74e-4b9e-ac3a-8555d488856a","year":2015},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.026963Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:563af777958a05e11b682834cce244c6f208178fc37b43fc6153ce6553c87be4","observation_id":"037507d0-6e59-480a-8909-10b6c301879e","resolution":{"observed_at":"2026-08-07T12:03:16.780192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.08324","last_updated":"2025-07-08T15:08:52Z","snapshot_observed_at":"2026-07-06T19:49:30.260410Z","submitted_at":"2024-11-13T04:20:20Z","title":"Are LLMs Prescient? A Continuous Evaluation using Daily News as the Oracle","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.08324","snapshot_observed_at":"2026-08-07T12:03:10.072436Z","title":"Are LLMs prescient? A continuous evaluation using daily news as the oracle","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.072436Z"},"links":{"cited_paper":"/paper/2411.08324","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:f41b8b237ef6addd3cc06b05be07b0b758ddbf01527cf9f9533e898329ff4d2b","observation_id":"81d3b48b-6987-454d-a686-529767dd38d6","resolution":{"observed_at":"2026-08-07T12:03:10.072436Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.630753Z","title":"Polymarket settles a market incorrectly -- again, 2024","venue":null,"work_id":"485eb053-be7d-4166-aa74-ee11f69f2845","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.160852Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:16e3ae33c371505b584905992d4e237426b0db6af197fb5f88dc6335d5efb8f7","observation_id":"1034a219-7dc6-4945-bbc2-7064498400e2","resolution":{"observed_at":"2026-08-07T12:03:16.689678Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.482298Z","title":"Survivorship bias and mutual fund performance","venue":null,"work_id":"110e02c8-a9ae-44d2-8696-247fbc41c9ac","year":1996},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.248562Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:078176f2a1ae07579c6765d1d0e47ecfccc4090eed761e808f455d404cdf5cc1","observation_id":"084f463d-3204-4746-9242-a9438e42eb8c","resolution":{"observed_at":"2026-08-07T12:03:16.564852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"status/1833295","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:13.683926Z","title":"Knowledge cutoff issues of GPT -4o regarding Phan et al","venue":null,"work_id":"01f43a34-edfd-49bf-be7c-aa675050ea41","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.321182Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:e281906979e8848a2dc303d9f7b85e21e50ee662b264f269cd37e5238f83eb7c","observation_id":"93bbe428-7ea9-49c9-9544-5ce20d872745","resolution":{"observed_at":"2026-08-07T12:03:13.757585Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.349668Z","title":"Approaching human-level forecasting with language models, 2024","venue":null,"work_id":"ab986720-31b1-4fb4-bd1a-6d92c7309443","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.355084Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:1771c4f5fa1858fc84c3219658c1edd6917a24c5e5b0b19427d972933da97d35","observation_id":"1c467d53-bd57-4b8a-9770-f932f675f4ec","resolution":{"observed_at":"2026-08-07T12:03:16.416133Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:16.139940Z","title":"Introducing the SalemCSPi forecasting tournament, 2022","venue":null,"work_id":"2b3386de-e9be-4ca4-90ce-42aa78033e16","year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.431995Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:28c04110457d9f6d382574b633d9ad0b72e8e28d49032212f2862460742307e8","observation_id":"2f2fb106-dc43-41f6-b143-ff665d282ee4","resolution":{"observed_at":"2026-08-07T12:03:16.267368Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:10.531282Z","title":"The emerging science of machine learning benchmarks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.531282Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:ed9f1cf29f3eb582b217d6845d14f67479edd27ef2f06595aa54fe9529feee87","observation_id":"10b7605b-328b-414b-bfb2-c073521dcc7b","resolution":{"observed_at":"2026-08-07T12:03:10.531282Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12036","last_updated":"2024-10-31T23:08:03Z","snapshot_observed_at":"2026-07-06T19:04:18.161175Z","submitted_at":"2024-08-21T23:42:06Z","title":"Reasoning and Tools for Human-Level Forecasting","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12036","snapshot_observed_at":"2026-08-07T12:03:10.604051Z","title":"Reasoning and tools for human-level forecasting","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.604051Z"},"links":{"cited_paper":"/paper/2408.12036","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:666709715b4a5da14faf755f4943649a4ef94e5263fbc8e308bd2a931d1635d0","observation_id":"4206fdb4-2ab0-45c9-8bfb-4752d2fa8abb","resolution":{"observed_at":"2026-08-07T12:03:10.604051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.908829Z","title":"asgeirtj/system\\_prompts\\_leaks/claude.txt, 2025","venue":null,"work_id":"fed373a1-029a-4358-8d40-79b3d9291983","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.709829Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:c0c90bb91b8e1ab35b45afe4abf67f955c7ccad2e5c7f69b42c427a9a2396b69","observation_id":"a23e1240-1b11-4fd8-b1a1-b396f8969ca0","resolution":{"observed_at":"2026-08-07T12:03:16.056698Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.19839","last_updated":"2025-02-28T12:35:34Z","snapshot_observed_at":"2026-07-06T19:24:12.811792Z","submitted_at":"2024-09-30T00:41:51Z","title":"ForecastBench: A Dynamic Benchmark of AI Forecasting Capabilities","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.19839","snapshot_observed_at":"2026-08-07T12:03:10.828930Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.828930Z"},"links":{"cited_paper":"/paper/2409.19839","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:01ba5672afddf3f83bf2832d080a0438741e97ad5625936ef15ed127913dd76a","observation_id":"4261ec35-ba33-4678-b329-acfc6b24422d","resolution":{"observed_at":"2026-08-07T12:03:10.828930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.569055Z","title":null,"venue":null,"work_id":"5e1e9032-6208-4ad0-95b2-f842eaea0dbb","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:10.987478Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:177cccb6e841ef15db64a08ede71c40abaf60fb0e30152d7cefac0b628d1b68c","observation_id":"3af1629b-f9e9-4d1c-893f-d1f57703d2f4","resolution":{"observed_at":"2026-08-07T12:03:15.733151Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.12220","last_updated":"2024-10-30T12:14:35Z","snapshot_observed_at":"2026-08-07T19:54:01.229017Z","submitted_at":"2024-07-17T00:06:30Z","title":"Questionable practices in machine learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.12220","snapshot_observed_at":"2026-08-07T12:03:11.167415Z","title":"Questionable practices in machine learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.167415Z"},"links":{"cited_paper":"/paper/2407.12220","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:1a861d46c2d7b2de63ca3d1d68c13cf0ce20d4181b81491808024688a1c8c275","observation_id":"c3a89c4a-108d-4a58-a55e-a451665968ab","resolution":{"observed_at":"2026-08-07T12:03:11.167415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.340049Z","title":"Acx2025 tournament, 2025","venue":null,"work_id":"908386ff-72e1-4d22-9dbb-1ba6a564301d","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.289628Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:e376d6d004ab59c66a4e060511e1503578c492820c0e30113995ff5e1b9aa171","observation_id":"e4337b8f-8b2c-44c6-b27f-7d7c9406e5ab","resolution":{"observed_at":"2026-08-07T12:03:15.449049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.18544","last_updated":"2025-01-10T01:06:06Z","snapshot_observed_at":"2026-08-03T21:07:56.054263Z","submitted_at":"2024-12-24T16:51:35Z","title":"Consistency Checks for Language Model Forecasters","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.18544","snapshot_observed_at":"2026-08-07T12:03:11.460739Z","title":"Consistency checks for language model forecasters","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.460739Z"},"links":{"cited_paper":"/paper/2412.18544","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:496991e1f4192e6910f60f62e98ed2c6309130af4d6a9c2dbb59428717e46af7","observation_id":"f1dd5fa7-feed-4d11-8c08-b93fb932308d","resolution":{"observed_at":"2026-08-07T12:03:11.460739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.235612Z","title":"LLMs are superhuman forecasters, 2024","venue":null,"work_id":"1f1e6853-a1ba-400e-809e-edb44ac040df","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.576117Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:a97e3074dcc6aa522c9d71f8aa75a541dab693f680388f39b445abdb3415ddcb","observation_id":"cb59e2c4-b5c7-4314-91db-9dc4371b1c52","resolution":{"observed_at":"2026-08-07T12:03:15.261662Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:15.077829Z","title":"White House planning face-to-face meeting with Biden , Xi , 2023","venue":null,"work_id":"8d1cc609-cccc-45f3-ace3-b98f92e05bde","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.683329Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:96f3da41a2f7d29f697221ee841b7817947402d2a96bd6524ed1f549b6f66ab7","observation_id":"03c3e534-b96b-4478-a828-ba15118f16e4","resolution":{"observed_at":"2026-08-07T12:03:15.152038Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.867677Z","title":"Against calibration, 2023","venue":null,"work_id":"989d3b0b-bf9c-40f9-abf9-008795ac11ac","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:11.840935Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:7c97a83c58199b7c1155f6fedc1ffc85cab5438c1437c554b77ede1e79ee1976","observation_id":"620e4317-0d9c-4058-8413-8af487b3e1ed","resolution":{"observed_at":"2026-08-07T12:03:14.980940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.690943Z","title":"Elicitation of personal probabilities and expectations","venue":null,"work_id":"e2d5639f-5ee1-4248-a18e-aca6e52476a6","year":1971},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.012201Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:20e8aa9432f26513eec4d724c150a781cf9fc5e9e95cf5f5421d6b1adbdecbdb","observation_id":"293735f7-c0f8-4e09-975c-8e979dfeb9e0","resolution":{"observed_at":"2026-08-07T12:03:14.776963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.511117Z","title":"Wisdom of the silicon crowd: LLM ensemble prediction capabilities rival human crowd accuracy","venue":null,"work_id":"1a8a20fc-816d-4595-b035-cc1c4656f16e","year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.184050Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:c1c66172c39063f542b380d2c08e4704bf64cec0c3ae6a76298b6efd6b95ac6e","observation_id":"bdbc0f9b-f1ae-4efe-a513-e64993ed50e7","resolution":{"observed_at":"2026-08-07T12:03:14.605476Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.11248","last_updated":"2023-02-03T17:29:49Z","snapshot_observed_at":"2026-08-05T12:37:11.571788Z","submitted_at":"2021-06-21T16:46:11Z","title":"Alignment Problems With Current Forecasting Platforms","version":3},"cited_work":{"arxiv_id":"2106.11248","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.11248","snapshot_observed_at":"2026-08-07T12:03:13.399543Z","title":"Alignment Problems With Current Forecasting Platforms","venue":"cs.GT","work_id":"7f3112d5-1a94-488a-b87e-b5aa3e2bdb2f","year":2021},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.352939Z"},"links":{"cited_paper":"/paper/2106.11248","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:d24334af3cd6b5d54eeb76288ee3d02429bb2e2cd8678041508730f5b20ec1bc","observation_id":"648b7389-af1c-4a8e-8eb0-89b27978a1cd","resolution":{"observed_at":"2026-08-07T12:03:13.513497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.356575Z","title":"Capital asset prices: A theory of market equilibrium under conditions of risk","venue":null,"work_id":"711917be-6bdd-488a-b6cb-e6d6a93f7ad5","year":1964},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.469848Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:106a25de506f461fc0e3d2fd31a3aa6198be880c186e7ed7cda407e3dfa6c5af","observation_id":"25dddb8a-09c6-497c-b130-65a4dcef2246","resolution":{"observed_at":"2026-08-07T12:03:14.404486Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.171738Z","title":"Risk-adjusted performance of mutual funds","venue":null,"work_id":"2f0c0155-6deb-418d-b9c7-181069e3828f","year":1998},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.611811Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:df2e31da4e3ceeb13e062669ad0688ead5719bcf20069fed8801118f0a792650","observation_id":"74a58ae5-6806-4c10-8ac8-76e40365a06d","resolution":{"observed_at":"2026-08-07T12:03:14.286663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:12.780222Z","title":"PROPHET : An inferable future forecasting benchmark with causal intervened likelihood estimation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.780222Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:f1a146cd29aa43215996c7615f949ef02c4c75a00bb755f84b7daf700f7911e9","observation_id":"b5daf215-3ab5-484f-bcd8-4303013fc21f","resolution":{"observed_at":"2026-08-07T12:03:12.780222Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:12.926278Z","title":null,"venue":null,"work_id":null,"year":2000},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:12.926278Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:b16d4dc9eb58f9a9b77203c1b45f0ad8b573cd40c7beb4375e5336015c8c7f89","observation_id":"5860ebad-17b9-471c-98f0-d79321ead696","resolution":{"observed_at":"2026-08-07T12:03:12.926278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:14.016176Z","title":"Biden , Xi talks in san francisco, 2023","venue":null,"work_id":"62871633-71fb-4301-b5b7-eece7474db72","year":2023},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.000775Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:e8e38dd7710fddc3b8e2e750ededf4b7e45cd24ca570f468b6d6b4d095f3a0c7","observation_id":"0b6b46fc-3ac1-4d28-be7b-f2bda0e20f4c","resolution":{"observed_at":"2026-08-07T12:03:14.088043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:03:13.856773Z","title":"Haooowang/llm-knowledge-cutoff-dates, 2025","venue":null,"work_id":"0bc4d87d-f545-493a-967d-e2294b1d6704","year":2025},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.072803Z"},"links":{"citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:55d9fb88c62e263358cf219d029ad52abe32508dbcd495d830b96856500801c1","observation_id":"45783a36-cbed-4005-8c2a-bace7637202f","resolution":{"observed_at":"2026-08-07T12:03:13.939127Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01364","last_updated":"2024-02-07T07:14:39Z","snapshot_observed_at":"2026-08-04T18:35:41.659861Z","submitted_at":"2024-02-02T12:34:09Z","title":"Continual Learning for Large Language Models: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01364","snapshot_observed_at":"2026-08-07T12:03:13.143938Z","title":"Continual learning for large language models: A survey, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.143938Z"},"links":{"cited_paper":"/paper/2402.01364","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:7a7095628c752eb76ea0477681b034cb5434f3e49f9f5e25cdccb91d17b297c1","observation_id":"563017a7-53f1-4f38-8427-44b697a05264","resolution":{"observed_at":"2026-08-07T12:03:13.143938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2206.15474","last_updated":"2022-10-09T23:32:19Z","snapshot_observed_at":"2026-07-06T13:26:33.250328Z","submitted_at":"2022-06-30T17:59:14Z","title":"Forecasting Future World Events with Neural Networks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.15474","snapshot_observed_at":"2026-08-07T12:03:13.238164Z","title":"Forecasting future world events with neural networks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-07T12:03:13.238164Z"},"links":{"cited_paper":"/paper/2206.15474","citing_paper":"/paper/2506.00723"},"observation_digest":"sha256:8c11eb9005974539ce2f8641277d6a3ec032c9e1bb5c2444c32875a407d21a6e","observation_id":"f9828a89-a1a4-4c55-8a63-67ecea5018c4","resolution":{"observed_at":"2026-08-07T12:03:13.238164Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.00723","last_updated":"2025-05-31T21:49:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-07T11:57:07.802306Z","submitted_at":"2025-05-31T21:49:17Z","title":"Pitfalls in Evaluating Language Model Forecasters"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":11,"verified_exact":2,"verified_fuzzy":22},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 9 inbound Pith citation observations for arXiv:2506.00723."}