{"as_of":"2026-08-08T23:51:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:0902616144799adc447fbab143a2dec2ccdfd8200c5d8f03852c412e7cf9607b","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T23:25:20.526555Z","state":"measured"},{"denominator":35,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":35,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.05797/citation-record","integrity":"/paper/2608.05797/integrity","json":"/paper/2608.05797/citation-record.json","paper":"/paper/2608.05797"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2512.13961","last_updated":"2026-04-14T15:12:44Z","snapshot_observed_at":"2026-08-07T08:18:31.274999Z","submitted_at":"2025-12-15T23:41:48Z","title":"Olmo 3","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2512.13961","snapshot_observed_at":"2026-08-07T23:25:20.458447Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.458447Z"},"links":{"cited_paper":"/paper/2512.13961","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:11ef233d41244dd54112acdc4bd5f93d54ae152497b8605ffec1a3b96ec237ee","observation_id":"e0bba2fe-0bb1-491b-834e-ac0d945a7719","resolution":{"observed_at":"2026-08-07T23:25:20.458447Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.889632Z","title":"Mle-bench: Evaluating machine learning agents on machine learning engineering","venue":null,"work_id":"2db94ef6-570c-469a-b2b5-eae744e67b11","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.403156Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:d07b26a4bc1723d6bc6eab21f04a921fcf9d3fcb0107e769e5893786c467bfe8","observation_id":"3a9ab401-4ba1-4e9c-b875-53a64c9060c8","resolution":{"observed_at":"2026-08-07T23:25:21.893612Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.864848Z","title":"Demystifying prompts in language models via perplexity estimation","venue":null,"work_id":"96664588-8520-402b-be7d-948835b328cf","year":2023},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.419707Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:4f6e79250005a5da26929698a7499c8438d2c63ed3a2c8b12325bc9061ffee0d","observation_id":"78735c52-245e-4f5a-84b6-7a589b4e3369","resolution":{"observed_at":"2026-08-07T23:25:21.868696Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T23:25:20.423485Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.423485Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:fb478b1c6c0eadce6dd61786bdc74dc5c63e9269321857cc06b1bc07f3ad70ab","observation_id":"a34605f4-7e0a-4eb8-8c5d-973f3a906b82","resolution":{"observed_at":"2026-08-07T23:25:20.423485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.431316Z","title":"A rosetta stone for ai benchmarks.arXiv preprint arXiv:2512.00193,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.431316Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0dbfddfeb97d4641fbc141924ee2949ee5d47fba218ec08ac5163d51640fbc59","observation_id":"e95e670e-c795-4c33-a69c-fdad96b649c1","resolution":{"observed_at":"2026-08-07T23:25:20.431316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1312.6114","last_updated":"2022-12-10T21:04:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2013-12-20T20:58:10Z","title":"Auto-Encoding Variational Bayes","version":11},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1312.6114","snapshot_observed_at":"2026-08-07T23:25:20.438878Z","title":"Auto-encoding variational bayes.arXiv preprint arXiv:1312.6114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.438878Z"},"links":{"cited_paper":"/paper/1312.6114","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:385307614f546b191422bea52f489b7df227f5916850b641cbdeb50f9145ff3c","observation_id":"e6404e38-164e-44a2-ad34-aeff77ee642e","resolution":{"observed_at":"2026-08-07T23:25:20.438878Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10677","last_updated":"2023-09-27T01:15:49Z","snapshot_observed_at":"2026-07-06T16:20:36.866744Z","submitted_at":"2023-09-19T15:02:58Z","title":"Estimating Contamination via Perplexity: Quantifying Memorisation in Language Model Evaluation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10677","snapshot_observed_at":"2026-08-07T23:25:20.442787Z","title":"Estimating contamination via perplexity: quantifying memorisation in language model evaluation.URL https://arxiv","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.442787Z"},"links":{"cited_paper":"/paper/2309.10677","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:cfc6168c4546b1a201f30368aaa39bed1777211115f1384af2d5f11b5d876d83","observation_id":"a9a3e6b1-6af2-40f7-8702-d757e1c18d07","resolution":{"observed_at":"2026-08-07T23:25:20.442787Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.07267","last_updated":"2026-07-02T11:08:50Z","snapshot_observed_at":"2026-08-06T00:59:19.514154Z","submitted_at":"2026-02-06T23:36:11Z","title":"BRIDGE: Predicting Human Task Completion Time From Model Performance","version":2},"cited_work":{"arxiv_id":"2602.07267","doi":null,"metadata_source":"pith","pith_arxiv_id":"2602.07267","snapshot_observed_at":"2026-08-07T23:25:21.497337Z","title":"BRIDGE: Predicting Human Task Completion Time From Model Performance","venue":"cs.AI","work_id":"6ecb5ee2-ec08-4bc3-ab51-00d6460a9a08","year":2026},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.446641Z"},"links":{"cited_paper":"/paper/2602.07267","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5d81e6b0691fff51325b51c1d0e603dfe17625f91b3a8f00b0d3bac32e1d4f97","observation_id":"0d40531c-cc6b-4a43-af1f-56815b822072","resolution":{"observed_at":"2026-08-07T23:25:21.501974Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.14868","last_updated":"2026-05-08T13:05:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-02-16T16:01:27Z","title":"Goldilocks RL: Tuning Task Difficulty to Escape Sparse Rewards for Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.14868","snapshot_observed_at":"2026-08-07T23:25:20.450375Z","title":"Goldilocks rl: Tuning task difficulty to escape sparse rewards for reasoning.arXiv preprint arXiv:2602.14868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.450375Z"},"links":{"cited_paper":"/paper/2602.14868","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:a97a5f58b25f006915256a6e5c2fa145781b3d344c8488597e005e9c0c4e8fa4","observation_id":"52501f48-9867-4a49-9d26-9ebe4f115ba3","resolution":{"observed_at":"2026-08-07T23:25:20.450375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.04374","last_updated":"2025-10-05T21:36:43Z","snapshot_observed_at":"2026-07-06T22:31:44.964774Z","submitted_at":"2025-10-05T21:36:43Z","title":"GDPval: Evaluating AI Model Performance on Real-World Economically Valuable Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.04374","snapshot_observed_at":"2026-08-07T23:25:20.466023Z","title":"Gdpval: Evaluating ai model performance on real-world economically valuable tasks","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.466023Z"},"links":{"cited_paper":"/paper/2510.04374","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:af5e26c9cafc87eb487164109529fefea82be0d2be0e827ab362de36fa214fbf","observation_id":"d0953aa5-4aa1-4722-8080-8571348054dc","resolution":{"observed_at":"2026-08-07T23:25:20.466023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.14249","last_updated":"2026-02-20T04:23:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-24T05:27:46Z","title":"Humanity's Last Exam","version":10},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.14249","snapshot_observed_at":"2026-08-07T23:25:20.470081Z","title":"Humanity’s last exam","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.470081Z"},"links":{"cited_paper":"/paper/2501.14249","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:d76db7c2578e6e70cef187950cd0f642e81485df079da5adfe04d021c5291e12","observation_id":"96e45a33-36d2-4edf-9b49-4e1945035ed4","resolution":{"observed_at":"2026-08-07T23:25:20.470081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04664","last_updated":"2020-05-28T20:51:40Z","snapshot_observed_at":"2026-07-06T09:03:37.435861Z","submitted_at":"2020-03-10T12:38:31Z","title":"Automatic Curriculum Learning For Deep RL: A Short Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04664","snapshot_observed_at":"2026-08-07T23:25:20.474015Z","title":"Auto- matic curriculum learning for deep rl: A short survey.arXiv preprint arXiv:2003.04664,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.474015Z"},"links":{"cited_paper":"/paper/2003.04664","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:64f0cc3ce0715e2d2c39db25adffc8d5c1977f707b8b325b8510a2873bedc77b","observation_id":"c6b5a2d5-e75f-492d-a705-1f756d3bd4c2","resolution":{"observed_at":"2026-08-07T23:25:20.474015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02309","last_updated":"2023-12-04T19:45:06Z","snapshot_observed_at":"2026-08-07T21:15:57.020690Z","submitted_at":"2023-12-04T19:45:06Z","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","version":1},"cited_work":{"arxiv_id":"2312.02309","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.02309","snapshot_observed_at":"2026-08-07T23:25:20.960410Z","title":"Training Reinforcement Learning Agents and Humans With Difficulty-Conditioned Generators","venue":"cs.AI","work_id":"5b62da78-db34-4f1b-b9f7-232c4c937b2b","year":2023},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.485277Z"},"links":{"cited_paper":"/paper/2312.02309","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:6f882a7589bcf0da9e3c42b065aeab922e7e7a01c1ffe40b93cf5c3803bd79e6","observation_id":"174efcb9-77d6-4e48-86a6-76dfe68948ad","resolution":{"observed_at":"2026-08-07T23:25:20.966619Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.13335","last_updated":"2025-03-17T16:15:02Z","snapshot_observed_at":"2026-08-07T16:57:21.932530Z","submitted_at":"2025-03-17T16:15:02Z","title":"Reliable and Efficient Amortized Model-based Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.13335","snapshot_observed_at":"2026-08-07T23:25:20.489045Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.489045Z"},"links":{"cited_paper":"/paper/2503.13335","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:0e2323cd2834503285ab03a963580685ac8e4fcb640508d7ac8522b60432a365","observation_id":"16b42bd2-0ff4-4ff3-a43f-fda7207f427b","resolution":{"observed_at":"2026-08-07T23:25:20.489045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04244","last_updated":"2024-06-06T16:41:39Z","snapshot_observed_at":"2026-07-30T15:43:06.151242Z","submitted_at":"2024-06-06T16:41:39Z","title":"Benchmark Data Contamination of Large Language Models: A Survey","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04244","snapshot_observed_at":"2026-08-07T23:25:20.498536Z","title":"Benchmark data contamination of large language models: A survey.arXiv preprint arXiv:2406.04244,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.498536Z"},"links":{"cited_paper":"/paper/2406.04244","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:a07e8c3dcd13552e5b05ad15fefa56cadf135a119293b2f6ccd71e5ecdf3cba2","observation_id":"a9d53eba-cd6f-4842-b84f-b86fbc306157","resolution":{"observed_at":"2026-08-07T23:25:20.498536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.503466Z","title":"An illusion of progress? assessing the current state of web agents.arXiv preprint arXiv:2504.01382,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.503466Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:d05c0f4c568acdd571decb4f5c68781b43ba65adeee9184c208a9a292cc5886d","observation_id":"0c8d5afb-8c2e-454f-9cf2-273d3799e70d","resolution":{"observed_at":"2026-08-07T23:25:20.503466Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-07T23:25:20.507412Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.507412Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:01e6a3f3980acdf34da4208c15e7611b88dff928d760a188791719e38761c839","observation_id":"708b96d4-f535-475c-b762-3cec4bfe223d","resolution":{"observed_at":"2026-08-07T23:25:20.507412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.847510Z","title":"Cybench: A framework for evaluating cybersecurity capabilities and risks of language models","venue":null,"work_id":"d1e25354-b8c3-46e5-a734-d10984f9ea2d","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.511381Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:97cf3b5686edcf48d881b5475ffec2c0533fcdf74d55b7a3b8dfcc6cdbb3e677","observation_id":"311b4df5-1aed-4769-ae55-d894cc6527ca","resolution":{"observed_at":"2026-08-07T23:25:21.851248Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.515298Z","title":"Edis: Diagnosing llm reasoning via entropy dynamics.arXiv preprint arXiv:2602.01288,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.515298Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:3ceab3ece31ad21ab87b02b40bc9cafd956a9d2864abb4e1d96e1081d0a968f3","observation_id":"05eabc8a-2683-4b64-944c-a0883605f3e2","resolution":{"observed_at":"2026-08-07T23:25:20.515298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.835730Z","title":null,"venue":null,"work_id":"fc7708fc-b61a-4b4b-a065-b8f0a5d1cfa8","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.518691Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:11fcbb87fe955986005a543fc3747632838be8aa6bf599fddde0f4db1a36dbb2","observation_id":"2911df35-45ae-4891-8e95-dc49273de9e2","resolution":{"observed_at":"2026-08-07T23:25:21.839752Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.824174Z","title":"A.2 IRT fitting details The IRT model is fit on the observed binary entries of the agent-task response matrix","venue":null,"work_id":"d40a3251-b00c-4ed3-84cd-587f0ff90612","year":2009},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.522497Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:764522b609ef7a1f080dee47e390fbf3607f6fc0606a3efe66d6f2c8a5011cb0","observation_id":"43ab6abf-30d6-46cc-aa29-6f637b18a21b","resolution":{"observed_at":"2026-08-07T23:25:21.828224Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.811285Z","title":null,"venue":null,"work_id":"fcabc337-4535-40ce-bb25-942c8a105d35","year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.526555Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2cd551472883c4529517e48d2b467016aae46342e907527c7f3baba7911b794e","observation_id":"f09895f7-b821-4cbf-aa18-3855e666cc36","resolution":{"observed_at":"2026-08-07T23:25:21.815890Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.17354","last_updated":"2025-03-21T17:54:01Z","snapshot_observed_at":"2026-08-07T16:45:51.002633Z","submitted_at":"2025-03-21T17:54:01Z","title":"HCAST: Human-Calibrated Autonomy Software Tasks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.17354","snapshot_observed_at":"2026-08-07T23:25:20.478107Z","title":"Hcast: Human-calibrated autonomy software tasks.arXiv preprint arXiv:2503.17354,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":1960,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.478107Z"},"links":{"cited_paper":"/paper/2503.17354","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:e21bd9164676694f10d17d705648e830f02d20321867f72e5e1a572471994778","observation_id":"448f91d0-4001-4474-ba87-47060b70a1fc","resolution":{"observed_at":"2026-08-07T23:25:20.478107Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15114","last_updated":"2025-05-27T03:32:23Z","snapshot_observed_at":"2026-08-01T07:23:06.300790Z","submitted_at":"2024-11-22T18:30:46Z","title":"RE-Bench: Evaluating frontier AI R&D capabilities of language model agents against human experts","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15114","snapshot_observed_at":"2026-08-07T23:25:20.492888Z","title":"Re-bench: Evaluating frontier ai r&d capabilities of language model agents against human experts.arXiv preprint arXiv:2411.15114,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":1978,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.492888Z"},"links":{"cited_paper":"/paper/2411.15114","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:cf56b24712ec1f8b30af50f2dd9ee259376e67eb32a47f1e28a618b92222a745","observation_id":"fd24008f-7d94-46d1-b45c-723447228ba8","resolution":{"observed_at":"2026-08-07T23:25:20.492888Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.11868","last_updated":"2026-01-17T01:29:30Z","snapshot_observed_at":"2026-07-06T22:41:58.373427Z","submitted_at":"2026-01-17T01:29:30Z","title":"Terminal-Bench: Benchmarking Agents on Hard, Realistic Tasks in Command Line Interfaces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.11868","snapshot_observed_at":"2026-08-07T23:25:20.454221Z","title":"Terminal-bench: Benchmarking agents on hard, realistic tasks in command line interfaces.arXiv preprint arXiv:2601.11868,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.454221Z"},"links":{"cited_paper":"/paper/2601.11868","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:4567448d81178f9eb1cffdbde61b5d040ba597e29cc903a1d7968b193efac258","observation_id":"4287b8ed-1894-4439-9cc8-db77e16e5bd2","resolution":{"observed_at":"2026-08-07T23:25:20.454221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.12284","last_updated":"2024-06-08T10:08:25Z","snapshot_observed_at":"2026-07-06T17:32:19.965690Z","submitted_at":"2024-02-19T16:51:29Z","title":"Refining Minimax Regret for Unsupervised Environment Design","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.12284","snapshot_observed_at":"2026-08-07T23:25:20.394203Z","title":"Refining minimax regret for unsupervised environment design.arXiv preprint arXiv:2402.12284,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2009,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.394203Z"},"links":{"cited_paper":"/paper/2402.12284","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:edfd4a30701ee9dcb3adf078beca972ec789c2cf9678b962c762135cd34abca8","observation_id":"aa97920f-3c40-4c05-9308-fa9bbbfcba3b","resolution":{"observed_at":"2026-08-07T23:25:20.394203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.434930Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2013,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.434930Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:01d76e1b027955031da71be6aaf1018198db7522b7ae6a712fd5e7b7ee578614","observation_id":"73b60335-e28b-496b-b9b9-fc4add245555","resolution":{"observed_at":"2026-08-07T23:25:20.434930Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.15149","last_updated":"2026-04-16T15:30:10Z","snapshot_observed_at":"2026-07-06T23:02:44.990811Z","submitted_at":"2026-04-16T15:30:10Z","title":"LLMs Gaming Verifiers: RLVR can Lead to Reward Hacking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.15149","snapshot_observed_at":"2026-08-07T23:25:20.427524Z","title":"Llms gaming verifiers: Rlvr can lead to reward hacking.arXiv preprint arXiv:2604.15149,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.427524Z"},"links":{"cited_paper":"/paper/2604.15149","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:48e17c13a9d994c396d9da209521156a9d71960730ccb1c09411be9ddebc61c1","observation_id":"fe6ff6e8-8897-44bf-9a39-46a31b45b999","resolution":{"observed_at":"2026-08-07T23:25:20.427524Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.00594","last_updated":"2026-07-20T11:38:10Z","snapshot_observed_at":"2026-08-06T22:51:32.576291Z","submitted_at":"2026-04-01T07:59:59Z","title":"Agent psychometrics: Task-level performance prediction in agentic coding benchmarks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.00594","snapshot_observed_at":"2026-08-07T23:25:20.415444Z","title":"Under review","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.415444Z"},"links":{"cited_paper":"/paper/2604.00594","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:93d6e7964ff5d6b9f5691eae047cd2ce09902b82eafb49182a5fd550ae4e6a36","observation_id":"3a2f6e1b-4f0c-4f52-8d32-bb4b8e9c97af","resolution":{"observed_at":"2026-08-07T23:25:20.415444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:21.876618Z","title":"Gen- eralization or memorization: Data contamination and trustworthy evaluation for large language models","venue":null,"work_id":"89576cf5-a31f-491a-94bb-3e5109086c03","year":2024},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.411400Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:2a6e9c96345403a4c1ae69b839bb158476e156d4884c2513942c391247a5b477","observation_id":"e07f15b2-fd35-44d4-8798-77fedaa9da41","resolution":{"observed_at":"2026-08-07T23:25:21.881241Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.481760Z","title":"Soft contamination means benchmarks test shallow general- ization.arXiv preprint arXiv:2602.12413,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.481760Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5f8dee39a00f689b8f2fd4dc1558f72bf52fb2b42fcee32babac0d96c1ddac47","observation_id":"b96fd2cc-786b-4f1f-806b-5527f438c682","resolution":{"observed_at":"2026-08-07T23:25:20.481760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.16941","last_updated":"2025-11-14T22:00:03Z","snapshot_observed_at":"2026-08-06T21:34:46.041153Z","submitted_at":"2025-09-21T06:28:17Z","title":"SWE-Bench Pro: Can AI Agents Solve Long-Horizon Software Engineering Tasks?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.16941","snapshot_observed_at":"2026-08-07T23:25:20.407209Z","title":"Swe-bench pro: Can ai agents solve long-horizon software engineering tasks?arXiv preprint arXiv:2509.16941,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.407209Z"},"links":{"cited_paper":"/paper/2509.16941","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:8fbd190e02cdaeafa960d403e7b45e519db3e49eca80d54a45814316a9075189","observation_id":"c1dd55f9-450c-4c5f-9925-693c8860ec52","resolution":{"observed_at":"2026-08-07T23:25:20.407209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06192","last_updated":"2026-03-11T18:00:18Z","snapshot_observed_at":"2026-08-03T13:42:05.563208Z","submitted_at":"2026-03-11T18:00:18Z","title":"The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?","version":1},"cited_work":{"arxiv_id":"2604.06192","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.06192","snapshot_observed_at":"2026-08-07T23:25:21.764616Z","title":"The Stepwise Informativeness Assumption: Why are Entropy Dynamics and Reasoning Correlated in LLMs?","venue":"cs.CL","work_id":"202f47fe-2e6f-4361-8843-779353826c92","year":2026},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.398733Z"},"links":{"cited_paper":"/paper/2604.06192","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:ecb96948483fbfd5f06fb72fbbe361fd59b1678d23e8ac352b0843f3b50ca151","observation_id":"25939d38-e636-4860-88cd-3a9c09926ee3","resolution":{"observed_at":"2026-08-07T23:25:21.774648Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T23:25:20.462141Z","title":"Attention head entropy of llms predicts answer correctness.arXiv preprint arXiv:2602.13699,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.462141Z"},"links":{"citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:45859bb2d501b07d8111567f371c00267102dd03dd54d5287435b0e8bb052b3b","observation_id":"a2a1c9aa-b064-4145-a9b9-eb1f5ed5b890","resolution":{"observed_at":"2026-08-07T23:25:20.462141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.22750","last_updated":"2026-04-29T17:20:11Z","snapshot_observed_at":"2026-07-06T23:09:05.682387Z","submitted_at":"2026-04-24T17:54:47Z","title":"How Do AI Agents Spend Your Money? Analyzing and Predicting Token Consumption in Agentic Coding Tasks","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.22750","snapshot_observed_at":"2026-08-07T23:25:20.389296Z","title":"How do ai agents spend your money? analyzing and predicting token consumption in agentic coding tasks.arXiv preprint arXiv:2604.22750,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-07T23:25:20.389296Z"},"links":{"cited_paper":"/paper/2604.22750","citing_paper":"/paper/2608.05797"},"observation_digest":"sha256:5f8958efc0f70a51b62451304facb3fb7590cbdd94b20f8c1e3567c0048f086e","observation_id":"a0bd2f59-d334-4cf0-b7c9-ef94231b0540","resolution":{"observed_at":"2026-08-07T23:25:20.389296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.05797","last_updated":"2026-08-06T09:33:09Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T23:16:56.649198Z","submitted_at":"2026-08-06T09:33:09Z","title":"Predicting Task Difficulty Without Rollouts"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":27,"verified_exact":3,"verified_fuzzy":5},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 0 inbound Pith citation observations for arXiv:2608.05797."}