{"as_of":"2026-08-09T06:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:11137d785bfe05496e0d4e42bd39bab30934ae397467e752c2071f42c8eac276","coverage":[{"denominator":62,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":62,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-05T20:07:03.928169Z","state":"measured"},{"denominator":63,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":63,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-09T12:24:33.998226Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-09T12:26:16.710584Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"cited_work":{"arxiv_id":"2508.11252","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.11252","snapshot_observed_at":"2026-07-09T12:26:16.710584Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","venue":"cs.AI","work_id":"9e81f7af-8636-4e59-9c2c-5accbbcf1508","year":2025},"citing_paper":{"arxiv_id":"2607.07391","last_updated":"2026-07-08T13:23:56Z","snapshot_observed_at":"2026-08-05T00:47:41.388747Z","submitted_at":"2026-07-08T13:23:56Z","title":"MIRA-Math: A Benchmark for Minimal Information Requesting and Mathematical Reasoning","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-07-09T12:24:33.998226Z"},"links":{"cited_paper":"/paper/2508.11252","citing_paper":"/paper/2607.07391"},"observation_digest":"sha256:2e30ccc83b7958734be95f52b8e0594bc49771fbb9d105dc2e1c239a503179a9","observation_id":"aa4ce1f3-3f5a-44b5-9695-194bfd0ae40b","resolution":{"observed_at":"2026-07-09T12:26:16.711939Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2508.11252/citation-record","integrity":"/paper/2508.11252/integrity","json":"/paper/2508.11252/citation-record.json","paper":"/paper/2508.11252"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.632919Z","title":"van Eemeren, Rob Grootendorst, Sally Jackson, Scott Jacobs, Agnes van Rees, Francisca Snoeck Henkemans, Eveline T","venue":null,"work_id":"e7ddc196-d42d-474f-9e1d-7eecb29d5f07","year":2001},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.190648Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8f8e8d9bb07c76579238306303b1d269e0d1cc16fdb219584ed39f1d02ccb749","observation_id":"46e93cf4-032b-4c97-b851-e926fb5e3dd1","resolution":{"observed_at":"2026-08-05T20:07:12.728559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.535458Z","title":"Dictionary of philosophy","venue":null,"work_id":"d6901451-863c-4799-9737-5aee0e32fbe4","year":1981},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.245217Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:a5d05725f2bae7ea7157ae0e74222b454f19cac320c6e5728921b8a90f8c8df3","observation_id":"a76876a4-59e5-4133-aee0-4ae45c21033f","resolution":{"observed_at":"2026-08-05T20:07:12.581522Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.440326Z","title":"McCarthy and P.J","venue":null,"work_id":"1a5d8465-3a73-4143-8242-f12fb7d0a9d1","year":1981},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.394610Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:9b83a3232ff79f8e3d785a36cd630e7e9645031536ede32fea5ebef76039b4ab","observation_id":"370b6277-7626-4223-a4a4-8ce3fdf716b4","resolution":{"observed_at":"2026-08-05T20:07:12.484770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.312573Z","title":"Programs with common sense, 1959","venue":null,"work_id":"5b3b9c67-b6ff-4142-a593-c025eae2b83a","year":1959},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.500892Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ad123b39fa646ae3651a9c74c0c0d805ebe3d2dfee6218ad5c0f1926fe3c2f4e","observation_id":"6283a7de-d9c5-4213-92df-a28911622977","resolution":{"observed_at":"2026-08-05T20:07:12.356361Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.213919Z","title":"Newell and H","venue":null,"work_id":"e2cf4075-cf91-4e24-a856-845ca3f51c7a","year":1956},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.644951Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:a9b17f215c41dcc1fbabbe96343bae95e5bb26b1e86cae7bc61bb61408fe2a0c","observation_id":"b63c295f-3367-4fc6-8bdf-0d54e7e06fae","resolution":{"observed_at":"2026-08-05T20:07:12.262508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-05T20:06:58.787169Z","title":"Openai o1 system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.787169Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b9cee03e9c978ba9c47c9f559853c160bf6f57810d8c5074328a61fc91430ed0","observation_id":"7bd09b23-7d48-4ca8-99bf-aa9a9404c831","resolution":{"observed_at":"2026-08-05T20:06:58.787169Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-05T20:06:58.934923Z","title":"Deepseek-r1: Incentivizing reasoning capability in llms via reinforcement learning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:58.934923Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:489c9a15d44c66cb215fa24852c639caa3a55dd58a3dd67f204bc63ba5daff53","observation_id":"98a098ea-9d90-4b3d-b421-de3ddcb3e9bc","resolution":{"observed_at":"2026-08-05T20:06:58.934923Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:12.086930Z","title":"2024 aime i","venue":null,"work_id":"f278da5b-8b54-409e-99da-de7adc1e35b7","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.038089Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:dc714d673643354dd97ab1e5c169a227291585731fbc507e55eb72089eb89d2c","observation_id":"7e1b6ea8-3138-4a37-98bf-503e9607f5b3","resolution":{"observed_at":"2026-08-05T20:07:12.165657Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.990625Z","title":"Let's verify step by step","venue":null,"work_id":"1c1f5c09-ed10-4a7c-92e6-ce71bb199f0e","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.117727Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b7621182105b71a8db6f8d487c3666af4d604150d3e906f9ec182d7c75873d3a","observation_id":"7a53f98a-62bf-43f9-9a55-9e3c0cc643d0","resolution":{"observed_at":"2026-08-05T20:07:12.035357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.882840Z","title":"Omni- MATH : A universal olympiad level mathematic benchmark for large language models","venue":null,"work_id":"cd6ec29f-6340-4fed-8620-3984f40cea5f","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.214909Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:20d470fcc6aa5e3b47f1fe5c891f47ffdab04ca64f278eb2191254bc16326095","observation_id":"eba0e665-bb2d-4ed3-903f-c5887baf8f86","resolution":{"observed_at":"2026-08-05T20:07:11.949130Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:06:59.358545Z","title":"Open r1: A fully open reproduction of deepseek-r1, January 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.358545Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:fcba9f443c74fc3736810a5bb9b2c0bca307332f00a69ab3c41d4e01567b0da3","observation_id":"6cf53a6a-4452-4e61-bc37-4641b64d79ce","resolution":{"observed_at":"2026-08-05T20:06:59.358545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.698415Z","title":"Clamber: A benchmark of identifying and clarifying ambiguous information needs in large language models","venue":null,"work_id":"82bea7d9-2467-4abe-8927-c2cc5feddca3","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.465558Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f3270969c3bd8f8ffb183b6cb0549cd2a34e25826220a800e2e84202d5b23d99","observation_id":"df75b3d2-5714-4907-8b0e-f846dab3f8c1","resolution":{"observed_at":"2026-08-05T20:07:11.794651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.604855Z","title":"Rethinking conversational agents in the era of llms: Proactivity, non-collaborativity, and beyond","venue":null,"work_id":"b20de20a-7300-4185-8db2-14e237bbd8fb","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.574990Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ef1a925716ba119639ff78bcc7bb63782b2e256187ceada49d66de73df0ee52b","observation_id":"386b49d3-e878-442f-84cd-25f37252c31a","resolution":{"observed_at":"2026-08-05T20:07:11.649126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:06:59.670963Z","title":"Li, Been Kim","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.670963Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:4aeccfe44c645a697052768fc35351070ec0ca993902fc70f77479ed70baf0c6","observation_id":"fd0d4cff-1480-45c6-b34f-09197e4f2f9a","resolution":{"observed_at":"2026-08-05T20:06:59.670963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.486505Z","title":"Reasoning attack: Inducing llm to never-end thinking, 2025","venue":null,"work_id":"a4a8cc30-04f4-4b68-8e97-fd94f37d624b","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.756678Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:222b6e9b27d3d0f4374609094ccbd0b775670428d12abcae21e4d4af37bd604e","observation_id":"d640403b-1be5-469e-ae88-de6dbf05c71f","resolution":{"observed_at":"2026-08-05T20:07:11.542959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:11.258911Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"7b426806-1127-4883-805d-0755171b0fa5","year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.850459Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8ed7beb2e9ad39f0dbeea889f4559d5761cc49fde0efdff9865616f72d712ff4","observation_id":"7919619a-e362-4901-8965-1a66dc01ce8c","resolution":{"observed_at":"2026-08-05T20:07:11.417146Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.19393","last_updated":"2025-03-01T06:07:39Z","snapshot_observed_at":"2026-07-06T20:29:11.710285Z","submitted_at":"2025-01-31T18:48:08Z","title":"s1: Simple test-time scaling","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.19393","snapshot_observed_at":"2026-08-05T20:06:59.954946Z","title":"s1: Simple test-time scaling","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-05T20:06:59.954946Z"},"links":{"cited_paper":"/paper/2501.19393","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:2df1be87559797cfd33adce9186d784063f678afe3097e115b031c5a44b8e762","observation_id":"8ae85c5a-de73-456d-9582-33f2c95668a5","resolution":{"observed_at":"2026-08-05T20:06:59.954946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.845227Z","title":"Bespoke-stratos Labs","venue":null,"work_id":"c2bd6e06-c6da-4230-9d3a-4190b8c865f5","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.050629Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:1b381c36fc8d2dc93215a28927ce45fd10bf69d173189bfa627492030c729b03","observation_id":"812c533b-10ff-4c3b-aeff-60ba40608fcd","resolution":{"observed_at":"2026-08-05T20:07:11.112782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-05T20:07:00.139772Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.139772Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f75d0abbccb0a2ec390aa76d2f37f0d66a2d381cf0d064ef950eba9c55e74a60","observation_id":"0855451a-dbc2-4725-a890-92e160cdfdac","resolution":{"observed_at":"2026-08-05T20:07:00.139772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.05862","snapshot_observed_at":"2026-08-05T20:07:00.246609Z","title":"Training a helpful and harmless assistant with reinforcement learning from human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.246609Z"},"links":{"cited_paper":"/paper/2204.05862","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:bd40dbf17b66661222cbaf2edf3b0612cac7575a6eb40ac25ddadd1cf5b10775","observation_id":"925a3393-d92f-4266-af04-2f787ab03547","resolution":{"observed_at":"2026-08-05T20:07:00.246609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.489282Z","title":"Sky-t1: Train your own o1 preview model within \\ 450","venue":null,"work_id":"f2b92430-5b69-41f9-93df-b4e1f00c2bdd","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.355608Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:09feedbd61e281700dfd451b0cb795f2654bb3623850df3da248a26a51883566","observation_id":"2e340aae-809c-4196-9127-57d204cb4abe","resolution":{"observed_at":"2026-08-05T20:07:10.674559Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.11284","last_updated":"2025-01-20T05:44:01Z","snapshot_observed_at":"2026-08-06T13:30:45.600197Z","submitted_at":"2025-01-20T05:44:01Z","title":"RedStar: Does Scaling Long-CoT Data Unlock Better Slow-Reasoning Systems?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.11284","snapshot_observed_at":"2026-08-05T20:07:00.485136Z","title":"Redstar: Does scaling long-cot data unlock better slow-reasoning systems? arXiv preprint arXiv:2501.11284 , 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.485136Z"},"links":{"cited_paper":"/paper/2501.11284","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:ef606feb7a9ce4977ebe5edd34c40a9e389014c61b01bbe097d03bd21c5fa2cd","observation_id":"1543a353-e86a-4853-b45d-d8927b37cbc1","resolution":{"observed_at":"2026-08-05T20:07:00.485136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.308487Z","title":"Qwen3: Think deeper, act faster","venue":null,"work_id":"15460222-9cd5-455b-9da9-0f0d070767f0","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.591595Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:fd00f47fd4854beba8c2d4288845a820f3decd873be21eb7844326cce8eb5ab2","observation_id":"683f945d-43e1-4346-ae69-9d6eb0b96bd3","resolution":{"observed_at":"2026-08-05T20:07:10.365162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:10.124937Z","title":"Claude 3.7 sonnet and claude code","venue":null,"work_id":"5cbe4c0b-86ee-420f-85a5-e1fd9359a673","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.699335Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:19deb25a4fd7132ece621a1f4b1ee29dad03ec04c536bb28262531c26d43cadc","observation_id":"b74a40ff-1242-4935-853b-dae7802d9374","resolution":{"observed_at":"2026-08-05T20:07:10.221580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.942937Z","title":"Grok 3 beta — the age of reasoning agents","venue":null,"work_id":"0ae9cf08-07a4-459e-a4d6-22a5730d393d","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.778952Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b689543142342974075298b8bde22112d09db8546b6d7aa6cd00539fbf6b5dd2","observation_id":"717194d9-c392-4cae-a616-9d30993f1c48","resolution":{"observed_at":"2026-08-05T20:07:10.033377Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15594","last_updated":"2025-10-19T10:32:43Z","snapshot_observed_at":"2026-08-02T10:23:50.881300Z","submitted_at":"2024-11-23T16:03:35Z","title":"A Survey on LLM-as-a-Judge","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15594","snapshot_observed_at":"2026-08-05T20:07:00.871004Z","title":"A survey on llm-as-a-judge","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.871004Z"},"links":{"cited_paper":"/paper/2411.15594","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:180dfb2a5d325e617c24c0b49fe829839e8f80c1ce1f1e64600ec19a25e942ab","observation_id":"feb82631-4813-4c5b-9148-414021f9a9b6","resolution":{"observed_at":"2026-08-05T20:07:00.871004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.07301","last_updated":"2025-06-05T16:34:24Z","snapshot_observed_at":"2026-08-03T11:11:25.359494Z","submitted_at":"2025-01-13T13:10:16Z","title":"The Lessons of Developing Process Reward Models in Mathematical Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.07301","snapshot_observed_at":"2026-08-05T20:07:00.983996Z","title":"The lessons of developing process reward models in mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:00.983996Z"},"links":{"cited_paper":"/paper/2501.07301","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5850d4ba05e9c8cd4710c355b4f9f218ff1f87e1df4ff8d3fe4a5923e53b1d2a","observation_id":"fde7b267-3a0b-473f-a97e-4fb6b5eca28a","resolution":{"observed_at":"2026-08-05T20:07:00.983996Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.24290","last_updated":"2025-07-05T09:01:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-31T16:36:05Z","title":"Open-Reasoner-Zero: An Open Source Approach to Scaling Up Reinforcement Learning on the Base Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.24290","snapshot_observed_at":"2026-08-05T20:07:01.076649Z","title":"Open-reasoner-zero: An open source approach to scaling up reinforcement learning on the base model","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.076649Z"},"links":{"cited_paper":"/paper/2503.24290","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f48895edaab8a5ed1f9e714f89846feefff47d8f1ef060b472c1e97a1586b9cd","observation_id":"82397fd9-be3f-4701-be79-d949ae8adcb3","resolution":{"observed_at":"2026-08-05T20:07:01.076649Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.21187","snapshot_observed_at":"2026-08-05T20:07:01.215034Z","title":"Do not think that much for 2+ 3=? on the overthinking of o1-like llms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.215034Z"},"links":{"cited_paper":"/paper/2412.21187","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:813cd0c97261b1bd323e328ef1884bda420ff30cb84943f3b17f5415e2178acf","observation_id":"35fa5a0e-da24-46bb-8174-0f646ff6a458","resolution":{"observed_at":"2026-08-05T20:07:01.215034Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.763106Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions","venue":null,"work_id":"e073b433-bde3-4379-a2f4-b570f6ababde","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.280601Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b15cf725b03a654e3d7fd6484543a1af4260a33093bf0f280b182aa16c43e2e6","observation_id":"3bba2630-f867-4ec9-8945-ab843d9d2d02","resolution":{"observed_at":"2026-08-05T20:07:09.852083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.545964Z","title":"Distilling step-by-step! outperforming larger language models with less training data and smaller model sizes","venue":null,"work_id":"a1841366-a74b-49b1-9f88-8925727dc8d0","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.363095Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:00c44a4079ef8370eeae09189b3d3b1d3a2a491ed58518856ba532876d7e9dc3","observation_id":"f0d8dbf4-632b-46fa-ac4f-dcb6c23728ad","resolution":{"observed_at":"2026-08-05T20:07:09.715437Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-08-05T20:07:01.454580Z","title":"Distilling the knowledge in a neural network","venue":null,"work_id":null,"year":2015},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.454580Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5d24c16d8323c650c7dbdf2b1f874670d4470863bbcd9a6b5a2d1bdc4805645b","observation_id":"12ee1f7d-a8bb-4fec-b038-eca99d9085ee","resolution":{"observed_at":"2026-08-05T20:07:01.454580Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:09.286764Z","title":"Math-Verify: Math Verification Library","venue":null,"work_id":"d1ec2dbb-81c3-4113-bea6-0d9c8080e98a","year":null},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.521708Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:2d96c0070647a67694ff15110aabb1c832f4b9f3e3be6170542704c13093ebd7","observation_id":"83059a89-9761-47af-b6aa-e0b209a60029","resolution":{"observed_at":"2026-08-05T20:07:09.408545Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.11143","last_updated":"2025-10-09T12:22:46Z","snapshot_observed_at":"2026-07-31T12:28:37.704994Z","submitted_at":"2024-05-20T01:04:40Z","title":"OpenRLHF: An Easy-to-use, Scalable and High-performance RLHF Framework","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.11143","snapshot_observed_at":"2026-08-05T20:07:01.606002Z","title":"Openrlhf: An easy-to-use, scalable and high-performance rlhf framework","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.606002Z"},"links":{"cited_paper":"/paper/2405.11143","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3826b8c8a149b548d9074ab5a33ec3b93f7a590f61f9bc597ba3abe61eb54ae0","observation_id":"40f39d92-e928-4cdb-8c44-b759ec7efc31","resolution":{"observed_at":"2026-08-05T20:07:01.606002Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.981228Z","title":"Interference and inhibition in cognition and behavior: Unifying themes for educational psychology","venue":null,"work_id":"7e2b0bc3-2400-451a-9014-d7891df77a55","year":1999},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.695399Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:74b6e83904726541cb499333906d98938622a3c1d9cf25e1b682c7e749825085","observation_id":"1136c703-50c5-466f-b7ff-b7b6b98446e0","resolution":{"observed_at":"2026-08-05T20:07:09.160064Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.713800Z","title":"How students “unpack” the structure of a word problem: Graphic representations and problem solving","venue":null,"work_id":"df592285-0455-4592-9f45-5d30303fb9e1","year":2008},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.788385Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5d2775634ea73cef1f40d4467761ee7862578a4ad945c1715416183d3da00e5d","observation_id":"3bc7e2fb-86f4-4f89-83d1-2ae4594a183b","resolution":{"observed_at":"2026-08-05T20:07:08.776804Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.507542Z","title":null,"venue":null,"work_id":"c9cc4eb2-566d-40d8-b377-2b24790ffef3","year":1989},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.852303Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:17af81e82ecdc2b21893ceff1d00a94dd5af70e7b02b41dfd7d77e7e16f69bfc","observation_id":"dac55333-c023-47e4-ad17-4d65f1ebac92","resolution":{"observed_at":"2026-08-05T20:07:08.606236Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.312988Z","title":"Metacognition: A literature review","venue":null,"work_id":"4582ea87-01d0-44fe-aa4e-34c2bb55c8d2","year":2011},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.936919Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:3ef8b3843e82f36ffd7ac41228ecd05cc71e125fd419956d734261622d576be6","observation_id":"8d60990c-3ea2-4a7e-8f74-550313053840","resolution":{"observed_at":"2026-08-05T20:07:08.406532Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:08.075405Z","title":"Strategies for improving learner metacognition in health professional education","venue":null,"work_id":"b99073ab-ab55-4860-ae75-685727589aa7","year":2017},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:01.995855Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:a95ed79b9f63e6f46e261ee29e193a1fe4d0343c9ac89ad9ddac2c2b75849b11","observation_id":"cca27954-eebb-4e8a-a7d4-d7c8fe423332","resolution":{"observed_at":"2026-08-05T20:07:08.210450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01307","last_updated":"2025-08-15T15:21:46Z","snapshot_observed_at":"2026-08-08T21:52:29.510852Z","submitted_at":"2025-03-03T08:46:22Z","title":"Cognitive Behaviors that Enable Self-Improving Reasoners, or, Four Habits of Highly Effective STaRs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01307","snapshot_observed_at":"2026-08-05T20:07:02.080403Z","title":"Cognitive behaviors that enable self-improving reasoners, or, four habits of highly effective stars","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.080403Z"},"links":{"cited_paper":"/paper/2503.01307","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:9f39496257021b6350fb73c55076fa028608ed531e73086e85b93d6c38eac3f2","observation_id":"ef5d890e-0c43-4392-8c98-7ca9a231aada","resolution":{"observed_at":"2026-08-05T20:07:02.080403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.871747Z","title":"A survey of deep active learning","venue":null,"work_id":"c31582d5-2814-4d6e-96a7-a72a56eb12ee","year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.145598Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:2169e947794e14c790421f1edb75afd370fd88ec688af524fa63fc066e3147ef","observation_id":"62942cf8-05e8-44b3-9002-0c9956cc902c","resolution":{"observed_at":"2026-08-05T20:07:07.968999Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.680615Z","title":"Deep bayesian active learning with image data","venue":null,"work_id":"aa7d1d77-b63f-4e93-835b-4d820ee288d7","year":2017},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.234196Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:c8e5cf76ba258086d7ec6a9e6263b42b572612bea04d707ad139e62138c1a1bc","observation_id":"9bf6058f-c77c-4194-a102-3fd4beb95319","resolution":{"observed_at":"2026-08-05T20:07:07.796796Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.451481Z","title":"Reinforcement learning: An introduction , volume 1","venue":null,"work_id":"7905c056-dcb5-4a3d-b253-dac8d32fafa4","year":1998},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.310110Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:e6e0e6f8cf0c69a4c9e831649b0470d5e2ac9019e4e653b624ddb7360684b8a6","observation_id":"ad39eb8c-7773-4d34-98e3-5954f177a0a4","resolution":{"observed_at":"2026-08-05T20:07:07.562472Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.10454","last_updated":"2024-10-06T17:34:15Z","snapshot_observed_at":"2026-08-04T06:52:01.276654Z","submitted_at":"2024-03-15T16:42:14Z","title":"Partially Observable Task and Motion Planning with Uncertainty and Risk Awareness","version":2},"cited_work":{"arxiv_id":"2403.10454","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.10454","snapshot_observed_at":"2026-08-05T20:07:04.234671Z","title":"Partially Observable Task and Motion Planning with Uncertainty and Risk Awareness","venue":"cs.RO","work_id":"07e1847d-d113-46b9-9014-3481873fc142","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.384922Z"},"links":{"cited_paper":"/paper/2403.10454","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f03bcd3b12c06510a7b128ce432b6c325d972eb964f5e19b523f9d99441b026e","observation_id":"c52c2a08-ece9-4395-8a33-e350216a0313","resolution":{"observed_at":"2026-08-05T20:07:04.307527Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:07.221792Z","title":"Combined task and motion planning under partial observability: An optimization-based approach","venue":null,"work_id":"c210b8ce-f1b4-44ad-a250-af024bc4c6d5","year":2019},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.475798Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:f3306e097179ecd8a5d1bcf6386f8bc742d6cba30c70099596fd8ff4e4f49376","observation_id":"7e5facde-f8c8-4345-b778-7db9d575b6f1","resolution":{"observed_at":"2026-08-05T20:07:07.331095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.996456Z","title":"The communicative function of ambiguity in language","venue":null,"work_id":"08c0ebbe-5579-4494-ae45-5a81a55d2b96","year":2012},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.560443Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:e9d00e42ed34bcc47417983730ca716f9283c206921586a93078cd1c5541dfc0","observation_id":"0b1c7b4b-5a4b-45aa-b921-d6890b2a258b","resolution":{"observed_at":"2026-08-05T20:07:07.103378Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.833504Z","title":"The puzzle of ambiguity","venue":null,"work_id":"a0743c31-dfe8-4052-b975-b57bc5ad0f60","year":2005},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.645566Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:0da5fd14255ed0c17c0680d5efef1ebf20b3497bfdb3cc60a3d9d1f36cae47f9","observation_id":"9e8c9df5-a049-484b-b03c-fb9c513cac9d","resolution":{"observed_at":"2026-08-05T20:07:06.910037Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.629310Z","title":"Semantic ambiguity within and across languages: An integrative review","venue":null,"work_id":"ad63ebe3-1d3a-49e1-a820-66272dd7bca4","year":2010},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.733138Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b71fd6eb2e31ca7c28bb0952a933a871fb52522deee8f8ada1da65d1952de286","observation_id":"43c56b16-8780-4f11-87bb-f1f8ff5ba0ad","resolution":{"observed_at":"2026-08-05T20:07:06.715372Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.365437Z","title":"What computers can’t do: The limits of artificial intelligence","venue":null,"work_id":"7cf74921-2d9c-47a4-bb06-f728da7bb017","year":1972},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.816955Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:670d4104b771022bda2bf15f859f541d3fece36c9305c911eacb8010cf7fb66c","observation_id":"996c406a-4b06-4770-86ac-2fc167ea365f","resolution":{"observed_at":"2026-08-05T20:07:06.478269Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09932","last_updated":"2024-09-06T00:46:40Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T16:58:28Z","title":"Foundational Challenges in Assuring Alignment and Safety of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09932","snapshot_observed_at":"2026-08-05T20:07:02.902944Z","title":"Foundational challenges in assuring alignment and safety of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.902944Z"},"links":{"cited_paper":"/paper/2404.09932","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:7c2ccf986deeabe689606fc0b263f4f76e79e74eb776baadea3532d732fa4805","observation_id":"e0f6b72d-cb2b-44a1-a86b-39d5e21a3c38","resolution":{"observed_at":"2026-08-05T20:07:02.902944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.05714","last_updated":"2025-05-22T05:58:23Z","snapshot_observed_at":"2026-07-06T20:19:02.999488Z","submitted_at":"2025-01-10T05:15:14Z","title":"How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and Beyond","version":4},"cited_work":{"arxiv_id":"2501.05714","doi":null,"metadata_source":"pith","pith_arxiv_id":"2501.05714","snapshot_observed_at":"2026-08-05T20:07:04.073932Z","title":"How to Enable Effective Cooperation Between Humans and NLP Models: A Survey of Principles, Formalizations, and Beyond","venue":"cs.CL","work_id":"47c90e43-4793-4bf6-bff6-3091109a26ca","year":2025},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:02.991235Z"},"links":{"cited_paper":"/paper/2501.05714","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:90f588080ac4d104af6eef4e26f92151a57be87ce96200727841629e786d38e3","observation_id":"bce34754-5435-49c7-85d1-d7eeed121372","resolution":{"observed_at":"2026-08-05T20:07:04.127404Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:06.147976Z","title":"Semantic uncertainty: Linguistic invariances for uncertainty estimation in natural language generation","venue":null,"work_id":"e2bac9b1-c5da-4966-9a3c-a20430a2499d","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.077429Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:5de6ef544d166e92a91aa1ac2e26b27dda430736af47ed357935d32538db4a6f","observation_id":"21861de3-46da-4924-a50a-962d68c5d7e7","resolution":{"observed_at":"2026-08-05T20:07:06.214899Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.10645","last_updated":"2020-10-05T03:28:21Z","snapshot_observed_at":"2026-08-04T08:38:55.832006Z","submitted_at":"2020-04-22T15:42:13Z","title":"AmbigQA: Answering Ambiguous Open-domain Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.10645","snapshot_observed_at":"2026-08-05T20:07:03.139186Z","title":"Ambigqa: Answering ambiguous open-domain questions","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.139186Z"},"links":{"cited_paper":"/paper/2004.10645","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:057b7665af77e9f7b52947e743c50f26f97ab9a3a78631e393d01b89dc5d6bd8","observation_id":"5f92a559-b612-4dcf-bfbe-2adab9850b45","resolution":{"observed_at":"2026-08-05T20:07:03.139186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09911","last_updated":"2024-06-16T15:24:12Z","snapshot_observed_at":"2026-08-04T04:35:24.086370Z","submitted_at":"2024-04-15T16:35:41Z","title":"ChatShop: Interactive Information Seeking with Language Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.09911","snapshot_observed_at":"2026-08-05T20:07:03.226004Z","title":"Chatshop: Interactive information seeking with language agents","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.226004Z"},"links":{"cited_paper":"/paper/2404.09911","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:8b1443adcc188e849e1e1ba8df76df13974fc65a258a51b08b2080215f6acc33","observation_id":"38ffefd5-7b95-41c5-ab5a-a093a90e3186","resolution":{"observed_at":"2026-08-05T20:07:03.226004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.783526Z","title":"Style: Improving domain transferability of asking clarification questions in large language model powered conversational agents","venue":null,"work_id":"7daf5279-9cd7-44d6-9d91-c45cf58919bd","year":2024},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.313584Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:1dfc8cc739c7624eb945927e4c3481c32634c7d5aaf6fab5f8e907e7924e0fbe","observation_id":"101e6db0-1c75-4f15-974e-b079df9cc900","resolution":{"observed_at":"2026-08-05T20:07:05.933634Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.579578Z","title":"Prompting and evaluating large language models for proactive dialogues: Clarification, target-guided, and non-collaboration","venue":null,"work_id":"2cadfe9f-fc08-415a-98a9-c53d002ac40e","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.400260Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:c1d44030fdec213920ad3e2fc8918334211e1f13713990c9caa3b37cd297953b","observation_id":"f12f2614-8b02-43aa-92f8-4ceff6d62045","resolution":{"observed_at":"2026-08-05T20:07:05.688837Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.07769","last_updated":"2023-02-20T11:19:08Z","snapshot_observed_at":"2026-08-08T11:25:49.765781Z","submitted_at":"2022-12-15T12:47:18Z","title":"CLAM: Selective Clarification for Ambiguous Questions with Generative Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.07769","snapshot_observed_at":"2026-08-05T20:07:03.485390Z","title":"Clam: Selective clarification for ambiguous questions with generative language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.485390Z"},"links":{"cited_paper":"/paper/2212.07769","citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b7182db184ad71cc183548793bbe70d1bb892edecf244b0658c2d094b5e3cd7c","observation_id":"6f8c9949-2158-486e-a38a-f15f06fbbb6c","resolution":{"observed_at":"2026-08-05T20:07:03.485390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.368597Z","title":"Selectively answering ambiguous questions","venue":null,"work_id":"f8e1156e-ce04-4d5e-a1d2-ff0e7a828755","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.576713Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:b818e0599f8bd0d64d55f58fbd4f36889f1576f886db7fd674068ef85dac0892","observation_id":"558401d8-0e9d-4913-820d-01f876df472e","resolution":{"observed_at":"2026-08-05T20:07:05.482114Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:05.152022Z","title":"Multiwoz-a large-scale multi-domain wizard-of-oz dataset for task-oriented dialogue modelling","venue":null,"work_id":"7322e635-195a-4802-a5d1-41febe9c4328","year":2018},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.656980Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:523e15377782cd961ceeae5ac8369085e3100211c43216b24d5165c003bc992a","observation_id":"7805dadc-569b-4275-8b6a-582e6b7a74dc","resolution":{"observed_at":"2026-08-05T20:07:05.242301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.930959Z","title":"Towards scalable multi-domain conversational agents: The schema-guided dialogue dataset","venue":null,"work_id":"1bf37b07-7cc5-4381-ab0a-b46a5dd91f78","year":2020},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.743739Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:526b54058e86e08fe1f45bac29d2baf8896dc6017b31ca8d16021df0c73beaec","observation_id":"4a57f24e-63db-4e72-9e29-27f8ff31b604","resolution":{"observed_at":"2026-08-05T20:07:05.020669Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.720051Z","title":"We need to consider disagreement in evaluation","venue":null,"work_id":"bfcafdec-7e9f-466d-a790-70d01705edc1","year":2021},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.839908Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:439732a4460e72ecdd9d6e881c669ad2736ff38fd1097391a6af1646f2451f13","observation_id":"9ac5de61-2202-48e8-8946-673f04381adc","resolution":{"observed_at":"2026-08-05T20:07:04.803185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T20:07:04.594880Z","title":"Everyone’s voice matters: Quantifying annotation disagreement using demographic information","venue":null,"work_id":"d09dbbc6-256e-4c9e-98d0-2fc68ebc819e","year":2023},"citing_paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information","version":1},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-05T20:07:03.928169Z"},"links":{"citing_paper":"/paper/2508.11252"},"observation_digest":"sha256:9861821c092042c626a4f0e5149123cc0e6ea0ae8559c0bbb52fbcea5a641103","observation_id":"9b8e2b2c-3d43-4e59-8cac-9a8b70c433bb","resolution":{"observed_at":"2026-08-05T20:07:04.664550Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2508.11252","last_updated":"2025-08-15T06:42:00Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-08T07:13:37.375064Z","submitted_at":"2025-08-15T06:42:00Z","title":"Beyond Solving Math Quiz: Evaluating the Ability of Large Reasoning Models to Ask for Information"},"reference_resolution":{"displayed":62,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":20,"verified_exact":2,"verified_fuzzy":40},"total_outbound_references":62},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 62 of 62 outbound references and 1 inbound Pith citation observation for arXiv:2508.11252."}