{"as_of":"2026-08-12T04:20:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2b1665b47aa4f38b8a853b50a1807ec866442493753528454320935dde70be10","coverage":[{"denominator":64,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":64,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T18:11:50.734271Z","state":"measured"},{"denominator":64,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":64,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.06933/citation-record","integrity":"/paper/2608.06933/integrity","json":"/paper/2608.06933/citation-record.json","paper":"/paper/2608.06933"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2503.01743","last_updated":"2025-03-07T09:05:58Z","snapshot_observed_at":"2026-08-09T11:59:10.408717Z","submitted_at":"2025-03-03T17:05:52Z","title":"Phi-4-Mini Technical Report: Compact yet Powerful Multimodal Language Models via Mixture-of-LoRAs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01743","snapshot_observed_at":"2026-08-10T18:11:50.500125Z","title":"Phi-4-mini techni- cal report: Compact yet powerful multimodal language models via mixture-of-loras","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.500125Z"},"links":{"cited_paper":"/paper/2503.01743","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:94490247e9da0e498094e40c1a077e9ab75fe3617aefa250d7e3b4bd1c60c9fe","observation_id":"efa5d81a-ea7e-4542-bf75-bbb5206e26c7","resolution":{"observed_at":"2026-08-10T18:11:50.500125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.832170Z","title":"Aimo validation aime","venue":null,"work_id":"12537636-1169-4f8e-9833-ca2aa336f1c9","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.505213Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:7d0019f7fc28bae41b6d6f0d778b89dbefee66ad20d535cb46e64ac88765bf16","observation_id":"c656d1ed-f976-4f43-8346-17488b02d967","resolution":{"observed_at":"2026-08-10T18:11:51.835244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.823159Z","title":"Analysis of llms for educational question classification and generation","venue":null,"work_id":"6e5d8f90-fe4e-4509-abde-547ac7c9a5a6","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.510391Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:e39664a3a278ce791994bdb492d635ba58dd175b042cfb8e31d1d663e39f16f7","observation_id":"e1c4e43f-e11c-44d2-9268-e801337f9a0e","resolution":{"observed_at":"2026-08-10T18:11:51.826511Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.813748Z","title":"System card: Claude opus 4.7","venue":null,"work_id":"1bcfa8ac-c48e-48c4-974d-abad7a7eb6b1","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.514698Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ae4b1808d65379cf372d3cdcd2604f86b71879f3afa1afd4fbe9f03ddeb04e72","observation_id":"fc7fe6e0-3885-4b75-bf24-b4e8498a683c","resolution":{"observed_at":"2026-08-10T18:11:51.817292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.804300Z","title":"System card: Claude opus 5","venue":null,"work_id":"e4f5dbfa-a6ff-45dc-ab7f-f6b785e9a775","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.518591Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:703939ecadf531527bd0d80adcc94c67f371abcbb7df914262284e169687c148","observation_id":"1a194d04-16af-48b1-8f22-e8867c104af6","resolution":{"observed_at":"2026-08-10T18:11:51.807969Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08073","last_updated":"2022-12-15T06:19:23Z","snapshot_observed_at":"2026-08-02T04:53:58.766070Z","submitted_at":"2022-12-15T06:19:23Z","title":"Constitutional AI: Harmlessness from AI Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.08073","snapshot_observed_at":"2026-08-10T18:11:50.522196Z","title":"Constitutional ai: Harmlessness from ai feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.522196Z"},"links":{"cited_paper":"/paper/2212.08073","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3e446a9303b5125b8292ffd2fb8a6a3b81151973f8683e27ad41e291d1b44ae0","observation_id":"cd994603-6283-4096-9268-0d8779c6a027","resolution":{"observed_at":"2026-08-10T18:11:50.522196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.794343Z","title":"Verifiers: Environments for llm reinforcement learning","venue":null,"work_id":"02c96acf-e953-4175-9a10-a1c66df68f0e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.526191Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:cb029da97bb7f793fd98a1fad7c6cfb97179bed845204813b0f805429186260b","observation_id":"d11c07f1-1814-4591-8be7-dcb130a3dd06","resolution":{"observed_at":"2026-08-10T18:11:51.798183Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.13585","last_updated":"2025-06-16T15:08:02Z","snapshot_observed_at":"2026-08-11T09:20:49.392094Z","submitted_at":"2025-06-16T15:08:02Z","title":"MiniMax-M1: Scaling Test-Time Compute Efficiently with Lightning Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.13585","snapshot_observed_at":"2026-08-10T18:11:50.529325Z","title":"Minimax-m1: Scaling test-time compute eﬀiciently with lightning attention","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.529325Z"},"links":{"cited_paper":"/paper/2506.13585","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:99bc92a50100676438b1a289c990b30f4853880c3fdd0db0fe998ac738ad8d95","observation_id":"2a33e1fc-0531-41ec-b56d-5657949b5c17","resolution":{"observed_at":"2026-08-10T18:11:50.529325Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.03682","last_updated":"2025-09-09T21:50:16Z","snapshot_observed_at":"2026-08-07T23:17:26.856906Z","submitted_at":"2025-08-05T17:51:33Z","title":"Self-Questioning Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.03682","snapshot_observed_at":"2026-08-10T18:11:50.533353Z","title":"Self-questioning language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.533353Z"},"links":{"cited_paper":"/paper/2508.03682","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:314c013cd60c4cd5db5b062a0eae844b5bca1e58f62e985fc4fd876bdeb60ce2","observation_id":"a2c36d90-5999-4462-809d-ca347e4bc748","resolution":{"observed_at":"2026-08-10T18:11:50.533353Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.01335","last_updated":"2024-06-14T21:17:17Z","snapshot_observed_at":"2026-08-10T05:25:44.328250Z","submitted_at":"2024-01-02T18:53:13Z","title":"Self-Play Fine-Tuning Converts Weak Language Models to Strong Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.01335","snapshot_observed_at":"2026-08-10T18:11:50.537113Z","title":"Self-play fine-tuning converts weak language models to strong language models.arXiv preprint arXiv:2401.01335, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.537113Z"},"links":{"cited_paper":"/paper/2401.01335","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a4a408717de827af5bb8a39e00fb214bacb1a0ab94a1d2bf7a1afd499fcb7cd6","observation_id":"3b70dd9b-661e-499b-91e7-0b64f3646c59","resolution":{"observed_at":"2026-08-10T18:11:50.537113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.541212Z","title":"U-math: A university-level benchmark for evaluating mathematical skills in llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.541212Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:32076dbd6eb53962d2e92b1c8c924aa0a05ae251b9e0f54965177fcf52a05405","observation_id":"b6e85dcd-be73-4c7e-87ee-4d373da1fed9","resolution":{"observed_at":"2026-08-10T18:11:50.541212Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-10T18:11:50.544790Z","title":"Gemini 2.5: Pushing the frontier with ad- vanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.544790Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:50e45a306138677cba624795c45fd6a1304320aa9f10fd43f7b7cc2e5fc79d28","observation_id":"5fe46c7a-337b-4587-975b-ffe74e458367","resolution":{"observed_at":"2026-08-10T18:11:50.544790Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.785078Z","title":"Deepseek-v4: Towards highly eﬀicient million-token context intelligence, 2026","venue":null,"work_id":"f2b6930c-f384-41f8-899a-a44c903d6730","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.548548Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ed2a84e9b37763cbe21db08d4a7314b1d7a8e8fdf9a7a3329698f3e961d35ee6","observation_id":"bfbf7f72-bd7f-46fb-9747-130752a64c9e","resolution":{"observed_at":"2026-08-10T18:11:51.788567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.775464Z","title":"Beyond benchmarks: Matharena as an evaluation platform for mathematics with llms","venue":null,"work_id":"d774d9e9-3d73-49c2-bc9f-949f4c13f091","year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.551751Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ad6afed7848abeccbc5e7148e039b32532baf209ff7bd7fe578594d023e96755","observation_id":"e6fd9ef3-91cf-456e-80bf-b6fa8b9a2bb5","resolution":{"observed_at":"2026-08-10T18:11:51.779230Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.765560Z","title":"How useful are educational questions generated by large language models? InInternational Conference on Artificial Intelligence in Education, pages 536–542","venue":null,"work_id":"0877b455-e972-429a-b239-e5bde0d221b3","year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.558876Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:7f64c5dcc707fe39d7b8503069ae15b674dc793516336132a0a20df1c2fab001","observation_id":"502b1b30-aeec-434c-a469-96a9eae78ce8","resolution":{"observed_at":"2026-08-10T18:11:51.769622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.20293","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.409173Z","title":"When judgment becomes noise: How design failures in llm judge benchmarks silently undermine validity","venue":null,"work_id":"604e76ab-a3be-4573-a6e0-3d03ddef3a53","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.562383Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:2451278aaa02846b5a8a0e94c72d0bf9226364c3e0387593867535f584686f62","observation_id":"b97c7e30-5b05-44f8-b95d-d1498fbee8f1","resolution":{"observed_at":"2026-08-10T18:11:51.415104Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.06802","last_updated":"2026-06-23T06:45:36Z","snapshot_observed_at":"2026-07-13T08:50:52.244397Z","submitted_at":"2026-04-08T08:16:37Z","title":"Riemann-Bench: A Benchmark for Moonshot Mathematics","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.06802","snapshot_observed_at":"2026-08-10T18:11:50.566726Z","title":"Riemann-bench: A benchmark for moonshot mathematics","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.566726Z"},"links":{"cited_paper":"/paper/2604.06802","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:03ca1096555a98a2dd2152e4dfc9c8d0c713f828067148c6b644e52389a67eb4","observation_id":"5e14ca1b-cd89-40ca-be09-6ed819885903","resolution":{"observed_at":"2026-08-10T18:11:50.566726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06187","last_updated":"2025-07-08T17:14:44Z","snapshot_observed_at":"2026-08-07T20:33:47.251399Z","submitted_at":"2025-07-08T17:14:44Z","title":"The Delta Learning Hypothesis: Preference Tuning on Weak Data can Yield Strong Gains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06187","snapshot_observed_at":"2026-08-10T18:11:50.571844Z","title":"The delta learning hypothesis: Preference tuning on weak data can yield strong gains","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.571844Z"},"links":{"cited_paper":"/paper/2507.06187","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:be33f95c43f1bdc45e3a176305448611ba24137bc63f7d3d5162928f9c287c80","observation_id":"3a3848f3-e475-4b3c-b983-4fa9d7185d29","resolution":{"observed_at":"2026-08-10T18:11:50.571844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.755912Z","title":"Gemini 3 flash model card","venue":null,"work_id":"26e9f51f-40d2-482a-b583-a39a63795886","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.575958Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:83cad5036a3107bfb667a9a9738f60263e5c3b1d751b7084ddcc7073fda8f65d","observation_id":"1908bcf6-1392-4b46-ba21-976d9c9edb02","resolution":{"observed_at":"2026-08-10T18:11:51.759179Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.745555Z","title":"Gemini 3.1 flash-lite model card","venue":null,"work_id":"bcc5350f-5f09-4601-b464-3f166736f71a","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.579452Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:da0899bb7870ee87cd3dda5a7b8df43ba5ce8143078757a79ef6ae49659dcff3","observation_id":"53591b83-6564-4599-aa8e-4a31887a1be7","resolution":{"observed_at":"2026-08-10T18:11:51.749215Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.735457Z","title":"Gemini 3.1 pro model card","venue":null,"work_id":"37ed8720-6d1e-49a8-90cf-77cacb490e31","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.582850Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3d047a6bb2fb346891a41d07827edc2c38814f2f81cd0e19caa282a5a3b4502a","observation_id":"6c9421a9-4842-4779-b5b4-54b16209aaee","resolution":{"observed_at":"2026-08-10T18:11:51.739070Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-10T18:11:50.586404Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.586404Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:6f206af9e1e84b2831926c43ab8d078057d6c5b9c6462b4aa4fee95b19b84a0e","observation_id":"3a2faedb-eef0-4eec-a377-aa6d04d4d05e","resolution":{"observed_at":"2026-08-10T18:11:50.586404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-10T18:11:50.590169Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via rein- forcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.590169Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:6fbdbad57e7fb6c5a43bd38a21676a0993b9d119e4f5cf659d2d115c236431fc","observation_id":"0689c12c-473c-4bad-94a5-3b7222610bc0","resolution":{"observed_at":"2026-08-10T18:11:50.590169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19464","last_updated":"2024-02-29T18:55:03Z","snapshot_observed_at":"2026-08-12T00:44:25.562375Z","submitted_at":"2024-02-29T18:55:03Z","title":"Curiosity-driven Red-teaming for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19464","snapshot_observed_at":"2026-08-10T18:11:50.594053Z","title":"Curiosity-driven red-teaming for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.594053Z"},"links":{"cited_paper":"/paper/2402.19464","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ff03a03f70be6efbbbb44bbac22207aa8416a60c32baee6864728358d864305d","observation_id":"cc36bd4f-8cc3-4f4a-ae6d-c12fcbb776d3","resolution":{"observed_at":"2026-08-10T18:11:50.594053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.05004","last_updated":"2026-02-13T18:53:32Z","snapshot_observed_at":"2026-07-06T22:09:08.864232Z","submitted_at":"2025-08-07T03:38:16Z","title":"R-Zero: Self-Evolving Reasoning LLM from Zero Data","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.05004","snapshot_observed_at":"2026-08-10T18:11:50.597606Z","title":"R-zero: Self-evolving reasoning llm from zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.597606Z"},"links":{"cited_paper":"/paper/2508.05004","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:8a4c4e03ef837cc38b893b3c8a5e1fd08a9caf13dcf0d74df9a46675274a4dab","observation_id":"717ccbca-0a41-4166-934d-a655cdbebf2b","resolution":{"observed_at":"2026-08-10T18:11:50.597606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.725351Z","title":"Prime-rl, 2025","venue":null,"work_id":"d142827e-8ad5-4e7b-94e6-42a0bcdfdf9e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.601552Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:edae487aecd166a3d413a0b6f8378d059e562935603618cf263ddd03281f6fe2","observation_id":"294e66dd-40f2-4607-a481-a6879d9ca561","resolution":{"observed_at":"2026-08-10T18:11:51.728622Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.711159Z","title":"Dynabench: Rethinking benchmarking in nlp","venue":null,"work_id":"a042eb71-4966-4a81-83b5-c9e9e67eb55a","year":2021},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.604896Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:c31e5c5a386b424a2388e57e0a0bed0520562622b81a032bd5ed5be0aec0cfe9","observation_id":"6981e59b-bf3b-4d63-a84e-ae727692eeb7","resolution":{"observed_at":"2026-08-10T18:11:51.715982Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.608630Z","title":"Language self-play for data-free training","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.608630Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:7a3563ba1769718432307de58f5b9474873c7050e05ef62727602cc9940f2e47","observation_id":"446113b1-2f3f-45c2-8d67-7db549fc3486","resolution":{"observed_at":"2026-08-10T18:11:50.608630Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.700586Z","title":"Gon- zalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"ceed0d2d-66ed-4178-aae3-69e65351dac7","year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.612106Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3e18425e8daddb46823046c2f92b36891fa41ae315a847537bfba3b4e5e301b7","observation_id":"13df65dd-8607-4b72-b58b-5ff62c1e0e6d","resolution":{"observed_at":"2026-08-10T18:11:51.704162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.690157Z","title":"Math-verify: Math verification library, 2025","venue":null,"work_id":"08cb2f11-a62c-467f-965f-037259e1758a","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.615366Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9f299207b196fd798220a17baac87f22feedf11c40270e47fa7368af72d23dae","observation_id":"8967a8b7-97f8-4b70-9447-c1069477f143","resolution":{"observed_at":"2026-08-10T18:11:51.694071Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.679250Z","title":"Rewardbench: Evaluating reward models for language modeling","venue":null,"work_id":"48cbef3a-db46-485f-abaa-ac3732b1381e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.618711Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:8d9172c6ee1a18d3788b306aa3cd671ce18e29527b009a2b934ec0304f8e50fd","observation_id":"470ef701-a4ee-4aab-bebe-9a93953c26d2","resolution":{"observed_at":"2026-08-10T18:11:51.683200Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.621902Z","title":"Questbench: Can llms ask the right question to acquire informa- tion in reasoning tasks? arXiv preprint arXiv:2503.22674, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.621902Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9eb7cfe0893833beae610131e725e328be7f94834016c1e7d65403b94482cd37","observation_id":"4db5a174-e386-428a-8630-b85c6a3e28d2","resolution":{"observed_at":"2026-08-10T18:11:50.621902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.08351","last_updated":"2025-02-28T08:14:49Z","snapshot_observed_at":"2026-08-12T01:40:47.172920Z","submitted_at":"2024-07-11T10:03:47Z","title":"AutoBencher: Towards Declarative Benchmark Construction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.08351","snapshot_observed_at":"2026-08-10T18:11:50.625286Z","title":"Autobencher: Towards declarative benchmark construction.arXiv preprint arXiv:2407.08351, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.625286Z"},"links":{"cited_paper":"/paper/2407.08351","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a150d2eade070124a9eb1e5296895e99bdac9f990bf0d8b72080ff717ee9eb35","observation_id":"801b1703-644c-45e4-a82d-4a68979013a2","resolution":{"observed_at":"2026-08-10T18:11:50.625286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.08584","last_updated":"2026-01-13T14:06:03Z","snapshot_observed_at":"2026-08-11T12:20:54.589956Z","submitted_at":"2026-01-13T14:06:03Z","title":"Ministral 3","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.08584","snapshot_observed_at":"2026-08-10T18:11:50.629131Z","title":"Ministral 3","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.629131Z"},"links":{"cited_paper":"/paper/2601.08584","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:4c64de5cbd544d343569e1ff87181fbc235719b45c4475c943944811fbc0af00","observation_id":"eccba2ec-b5c9-4966-9b61-602506596432","resolution":{"observed_at":"2026-08-10T18:11:50.629131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.632730Z","title":"Spiral: Self-play on zero-sum games incentivizes reasoning via multi-agent multi-turn reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.632730Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:f431612a1b559505e1886ccbd5a1bdeb78b5215481a06b9432ce6b066e161757","observation_id":"830bbac3-fa23-4507-8b8c-9dc6609eb7a9","resolution":{"observed_at":"2026-08-10T18:11:50.632730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.635959Z","title":"Spice: Self-play in corpus environments improves reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.635959Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:7397ea9738e35012d6c75db5624ee7b5f049ef61bbe16235145601cb5ce1ada9","observation_id":"6df9bb33-e2e9-4959-8628-844643a2d72e","resolution":{"observed_at":"2026-08-10T18:11:50.635959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-09T20:34:52.923500Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-10T18:11:50.639187Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.639187Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ae2ea3721a92d27c539130e4cb097457ffd055d6dec2cbf9ce86a2557ef0680d","observation_id":"c0f1b392-dc92-424d-93f5-f5ee02f51058","resolution":{"observed_at":"2026-08-10T18:11:50.639187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.669005Z","title":"Towards robust mathematical rea- soning","venue":null,"work_id":"33a04835-d4f8-4bea-828d-b0514e7624fe","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.642628Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:ec2d204bd0a9b68bbe33de90a8144334316161446918410607d4a02c1f24665e","observation_id":"bd7f4f53-3487-4a99-8e93-2d96dcf06b93","resolution":{"observed_at":"2026-08-10T18:11:51.672607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.658156Z","title":"Learning to ask informative questions: En- hancing llms with preference optimization and expected information gain","venue":null,"work_id":"9940ee91-65d5-449d-a3fd-398828d3b8ed","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.645913Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:eeab799eb382fa4cf3fa6a06e15576c692a3e69d1102b94e9f23fe072681508b","observation_id":"4d3cd2da-5fee-41a4-ad8e-252993644ade","resolution":{"observed_at":"2026-08-10T18:11:51.661795Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-07-06T19:29:09.714725Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-10T18:11:50.649079Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language mod- els","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.649079Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:3b8d3a9f1e822e929a46442e150236f9890fbac8da45dfaad50a02a90cfde829","observation_id":"1b9e3709-9074-4b7a-964f-24c0a015d9fa","resolution":{"observed_at":"2026-08-10T18:11:50.649079Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.647342Z","title":"gpt-oss-120b & gpt-oss-20b model card, 2025","venue":null,"work_id":"ba76d43f-df9f-482e-9305-48f3e65aeed2","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.652805Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:1373368d2e61fde245d9b9089c59c02482582dc4b75df6f36e451e07107ff53c","observation_id":"2337c8a9-bd16-4d52-b42b-e13741159a0b","resolution":{"observed_at":"2026-08-10T18:11:51.650788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.637720Z","title":"Aime 2025","venue":null,"work_id":"d12f0584-5019-44e5-9101-57fcfe230e01","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.656289Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:38af56cc298195ba16fbc6b09a659ce9974619cfba840f66bcf91561e4a9495d","observation_id":"77a9dd4d-8c7f-40d2-9ff4-9b79293444a0","resolution":{"observed_at":"2026-08-10T18:11:51.641053Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.14678","last_updated":"2025-02-20T16:09:55Z","snapshot_observed_at":"2026-08-07T18:01:35.596368Z","submitted_at":"2025-02-20T16:09:55Z","title":"How to Get Your LLM to Generate Challenging Problems for Evaluation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.14678","snapshot_observed_at":"2026-08-10T18:11:50.660114Z","title":"How to get your llm to generate challenging problems for evaluation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.660114Z"},"links":{"cited_paper":"/paper/2502.14678","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:18769f67feb2c67d8819d8e67b282f0466df5bc8f929788dff072aaadd3f3648","observation_id":"b58bcdae-2001-4096-a004-b3c98b8db571","resolution":{"observed_at":"2026-08-10T18:11:50.660114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2601.17716","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.013071Z","title":"Do reasoning models ask better questions? a formal information-theoretic analysis on multi-turn llm games","venue":null,"work_id":"d27ab729-177e-4b34-bf97-a5d348c30e83","year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.663783Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9e6dc9e0b671e113134bea1a36dc5359b45f462cc8f74ca96eceb12c5e84656e","observation_id":"729b13b6-6126-4d9b-9e34-362ce2f64700","resolution":{"observed_at":"2026-08-10T18:11:51.021984Z","resolver_source":"raw_fallback","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.667571Z","title":"Qwen3.5: Towards native multimodal agents, February 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.667571Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:5415e035dfe9ee8def871bc8c97ea75619b6054ed01710492f0ec3eb289cc532","observation_id":"c1579d25-0b44-48db-9f2b-2aae01ab2e96","resolution":{"observed_at":"2026-08-10T18:11:50.667571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21009","last_updated":"2025-02-03T12:53:41Z","snapshot_observed_at":"2026-08-10T23:24:19.770308Z","submitted_at":"2024-07-30T17:55:36Z","title":"AI-Assisted Generation of Difficult Math Questions","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21009","snapshot_observed_at":"2026-08-10T18:11:50.670903Z","title":"Ai-assisted generation of diﬀicult math questions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.670903Z"},"links":{"cited_paper":"/paper/2407.21009","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:754362eaff7cc364825f7fbf2c0ebbf339fd1e1bd947578f7ea98542910577ce","observation_id":"ade2654e-b2f0-4134-95f6-032253e180fa","resolution":{"observed_at":"2026-08-10T18:11:50.670903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.03267","last_updated":"2026-05-01T23:55:43Z","snapshot_observed_at":"2026-08-02T10:52:10.211700Z","submitted_at":"2025-12-19T07:05:38Z","title":"OpenAI GPT-5 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.03267","snapshot_observed_at":"2026-08-10T18:11:50.674344Z","title":"OpenAI GPT-5 system card","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.674344Z"},"links":{"cited_paper":"/paper/2601.03267","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:6620366d233ea16b6782f29d93dcbeadc9ce56a118b73a4fe29d157957d10838","observation_id":"798d43d2-91fb-4ad5-8c88-5000b2d23e75","resolution":{"observed_at":"2026-08-10T18:11:50.674344Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.620893Z","title":"Beyondbench: Contamination-resistant evaluation of reasoning in language models","venue":null,"work_id":"f15e34cc-95c7-4c1a-9d17-447e43f146a7","year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.677929Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:36a4d01b3539072e63bb88490321c4201ae4fa024af9a75cc8129f1bea99628f","observation_id":"04dfdb9b-58a3-443b-b82c-a91d05bb4d86","resolution":{"observed_at":"2026-08-10T18:11:51.624628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.610560Z","title":"Debate, train, evolve: Self-evolution of language model reasoning","venue":null,"work_id":"98a37721-c247-47f8-99d8-bd7199f336b4","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.682230Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:970cf45b7807fedc535c2e1289f595c86a8304c74ebc5b2e53eb1f19e4568c49","observation_id":"84b9f1d0-f9c0-4e3a-8793-3930d68f25c2","resolution":{"observed_at":"2026-08-10T18:11:51.614286Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.598186Z","title":"Question generation for adaptive education","venue":null,"work_id":"5d17c001-3f83-45dd-9e11-482c6ca7b1f6","year":2021},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.685714Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:2055df3eb94fd6ac4bd27306f76c039e51ef9f7de504a051bbe7ed69ae836f63","observation_id":"7b02d0c2-6db0-42b1-b74b-4e51bc486618","resolution":{"observed_at":"2026-08-10T18:11:51.603605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.18880","last_updated":"2025-06-23T17:51:40Z","snapshot_observed_at":"2026-08-06T23:12:46.021492Z","submitted_at":"2025-06-23T17:51:40Z","title":"OMEGA: Can LLMs Reason Outside the Box in Math? Evaluating Exploratory, Compositional, and Transformative Generalization","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.18880","snapshot_observed_at":"2026-08-10T18:11:50.688938Z","title":"Omega: Can llms reason outside the box in math? evaluating exploratory, compositional, and transfor- mative generalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.688938Z"},"links":{"cited_paper":"/paper/2506.18880","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:17f03e43eb75d80d772d7aaf5ce4268963ec301ed9b1413d37074c4140d62fe1","observation_id":"e3115606-8d7d-4b7a-9c8c-e296f1eaddaa","resolution":{"observed_at":"2026-08-10T18:11:50.688938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.692728Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.692728Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:0f5e8263ca1153936ffd94b518413c05afb70f6c2fd2c7aa65d799ae999c962a","observation_id":"2fdd5fdb-76be-4f82-a8d9-9af7c4efd273","resolution":{"observed_at":"2026-08-10T18:11:50.692728Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.581971Z","title":"Learning to ask: When llm agents meet unclear instruction","venue":null,"work_id":"a2c0e70d-689f-48a0-a84a-703cef09977e","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.696110Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:05bf964bc6bf918821890afd0dc50c4bb7c1ebd991d5c91c0b8836369ba03bf7","observation_id":"cef34fe4-036b-4eb9-b6c4-173021f42e1b","resolution":{"observed_at":"2026-08-10T18:11:51.585605Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.571581Z","title":"Qg-net: a data-driven question generation model for educational content","venue":null,"work_id":"23ba4f7b-b707-4bc6-b160-fb94a8a34cc8","year":2018},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.699893Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:677a36dc770af543860b9cfd302aa3551e510a10d6fb8c1a6e7d01dbb40305b0","observation_id":"e86daf76-c118-47aa-a152-9bd2abd175f4","resolution":{"observed_at":"2026-08-10T18:11:51.575074Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-10T18:11:50.703480Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.703480Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:7401c9005a1ab4d75fafd753699ca6005765d1908aa1966d6d59153caac9b9a8","observation_id":"3827a995-fe82-479f-827c-fad9aa34672a","resolution":{"observed_at":"2026-08-10T18:11:50.703480Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.00839","last_updated":"2026-05-12T22:28:40Z","snapshot_observed_at":"2026-08-04T20:52:44.966486Z","submitted_at":"2025-11-02T07:42:51Z","title":"CodeClash: Benchmarking Goal-Oriented Software Engineering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.00839","snapshot_observed_at":"2026-08-10T18:11:50.707243Z","title":"Codeclash: Benchmarking goal-oriented software engineering","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.707243Z"},"links":{"cited_paper":"/paper/2511.00839","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:754b60f07fc8c5682eb8da5bd5c0c0ae3f27c25183f9d33c0eefa56376807733","observation_id":"332e910e-b7a3-4796-8889-a5c479063466","resolution":{"observed_at":"2026-08-10T18:11:50.707243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:50.712039Z","title":"Spell: Self-play reinforcement learning for evolving long-context language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.712039Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:12298e458bf40f37ea0a7be6f98286eb1145515f68590edb6d5f0a71f0092444","observation_id":"6f4e9e39-805f-47c8-8735-de2c4b13afd7","resolution":{"observed_at":"2026-08-10T18:11:50.712039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.560386Z","title":"Self-rewarding language models","venue":null,"work_id":"180fd2f3-bf11-4492-ba01-87e96279fc39","year":2024},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.715890Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:4ec9280553802922084ae1dae746f74f558d61a53fcbf80c7780c49c254b1ad7","observation_id":"db137e58-d118-44bd-8737-4d70c5a4cf97","resolution":{"observed_at":"2026-08-10T18:11:51.564988Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.03335","last_updated":"2025-10-16T08:23:36Z","snapshot_observed_at":"2026-08-11T20:12:00.210052Z","submitted_at":"2025-05-06T09:08:00Z","title":"Absolute Zero: Reinforced Self-play Reasoning with Zero Data","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.03335","snapshot_observed_at":"2026-08-10T18:11:50.719307Z","title":"Absolute zero: Reinforced self-play reasoning with zero data","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.719307Z"},"links":{"cited_paper":"/paper/2505.03335","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:f5f2dbdc14abe938ae4515ab38bbef14735ee299722f0f77405281a71ed1e96d","observation_id":"305a8755-5e38-4b90-a0f2-82ade91e0d16","resolution":{"observed_at":"2026-08-10T18:11:50.719307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.05252","last_updated":"2025-02-07T17:05:25Z","snapshot_observed_at":"2026-08-09T01:20:28.151253Z","submitted_at":"2025-02-07T17:05:25Z","title":"GSM-Infinite: How Do Your LLMs Behave over Infinitely Increasing Context Length and Reasoning Complexity?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.05252","snapshot_observed_at":"2026-08-10T18:11:50.722837Z","title":"Gsm-infinite: How do your llms behave over infinitely increasing context length and reasoning complexity? arXiv preprint arXiv:2502.05252, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.722837Z"},"links":{"cited_paper":"/paper/2502.05252","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:c0e1ff7bbf1f6336076f3aed4874a08b1e451cce45961747bd17f0f0010d1b7c","observation_id":"10e9ff3b-cd70-42d8-837b-aec9cd89632d","resolution":{"observed_at":"2026-08-10T18:11:50.722837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17167","last_updated":"2024-03-14T09:52:16Z","snapshot_observed_at":"2026-08-08T18:43:29.715488Z","submitted_at":"2023-09-29T12:04:14Z","title":"DyVal: Dynamic Evaluation of Large Language Models for Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17167","snapshot_observed_at":"2026-08-10T18:11:50.726572Z","title":"Dyval: Dy- namic evaluation of large language models for reasoning tasks.arXiv preprint arXiv:2309.17167, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.726572Z"},"links":{"cited_paper":"/paper/2309.17167","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:9f1aef1ab12f001dd648c24b79d8f4cd467c990912431038621eb2895a8363fb","observation_id":"8a1ffbb2-14d1-4c9c-96a8-296db5c6fda7","resolution":{"observed_at":"2026-08-10T18:11:50.726572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.548879Z","title":"Twinstar: A novel design for enhanced test question generation using dual-llm engine","venue":null,"work_id":"3237d7a2-74d0-4084-947a-fc922a6fc51c","year":2025},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.730185Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:4f0bc27288015ea8f1b3de5e86c721ce0d175fc4807b5a58a476a3e69a9db0d2","observation_id":"e6014fca-27b9-49a8-a167-f13dd9541fe1","resolution":{"observed_at":"2026-08-10T18:11:51.552784Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T18:11:51.538189Z","title":"no solution","venue":null,"work_id":"36c6f899-24bf-49e1-bc8e-5604b8195a53","year":2022},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.734271Z"},"links":{"citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:a7c5af97ffaa783fb4d96a687edc501cd9d06020b1ba3ed724fa50f9b0268c4b","observation_id":"3f023ab3-82ef-463e-95ad-277d9990bd64","resolution":{"observed_at":"2026-08-10T18:11:51.541583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.00674","last_updated":"2026-05-15T17:10:37Z","snapshot_observed_at":"2026-08-11T13:24:32.272927Z","submitted_at":"2026-05-01T13:56:34Z","title":"Beyond Benchmarks: MathArena as an Evaluation Platform for Mathematics with LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.00674","snapshot_observed_at":"2026-08-10T18:11:50.555244Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-10T18:11:50.555244Z"},"links":{"cited_paper":"/paper/2605.00674","citing_paper":"/paper/2608.06933"},"observation_digest":"sha256:2ef0147bb255244335ad93a9f3506e6065b5dd9df6ddc6f9fbb657da4972eb91","observation_id":"4b95facc-b5c9-4eab-b082-ebfa1f38030c","resolution":{"observed_at":"2026-08-10T18:11:50.555244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.06933","last_updated":"2026-08-07T08:06:38Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T04:10:25.319763Z","submitted_at":"2026-08-07T08:06:38Z","title":"Ask-E: An Environment for Calibrated Question Generation"},"reference_resolution":{"displayed":64,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":2,"verified_fuzzy":28},"total_outbound_references":64},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 64 of 64 outbound references and 0 inbound Pith citation observations for arXiv:2608.06933."}