{"as_of":"2026-08-07T17:17:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f17977ec09441624b336ea94fee897da7fb46a9589038976d7852584eede6d60","coverage":[{"denominator":61,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T15:22:55.728237Z","state":"measured"},{"denominator":61,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":61,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2608.02089/citation-record","integrity":"/paper/2608.02089/integrity","json":"/paper/2608.02089/citation-record.json","paper":"/paper/2608.02089"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.11473","last_updated":"2025-12-07T02:14:12Z","snapshot_observed_at":"2026-08-07T08:44:55.120774Z","submitted_at":"2025-07-15T16:43:41Z","title":"Chain of Thought Monitorability: A New and Fragile Opportunity for AI Safety","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.11473","snapshot_observed_at":"2026-08-04T15:22:54.216027Z","title":"Chain of thought monitorability: A new and fragile opportunity for AI safety, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.216027Z"},"links":{"cited_paper":"/paper/2507.11473","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a0bb3421480c333c93ff8f6cab029fafaa056a4749574524253f586f657828fc","observation_id":"a373dd73-b609-4f09-97fd-80d1fbab6cd3","resolution":{"observed_at":"2026-08-04T15:22:54.216027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11926","last_updated":"2025-03-14T23:50:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-14T23:50:34Z","title":"Monitoring Reasoning Models for Misbehavior and the Risks of Promoting Obfuscation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11926","snapshot_observed_at":"2026-08-04T15:22:54.308068Z","title":"Monitoring reasoning models for misbehavior and the risks of promoting obfuscation.arXiv preprint arXiv:2503.11926, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.308068Z"},"links":{"cited_paper":"/paper/2503.11926","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:dbbcf1b24fdb1068a437f6ff24f5e37c78db7cf696f86514280f17ad85a54904","observation_id":"e8199497-cb67-4eed-a4ba-2fb9fa508bdd","resolution":{"observed_at":"2026-08-04T15:22:54.308068Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.415009Z","title":"Monitoring monitorability","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.415009Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7f516bd17191e5c95b7b36189e9c78d06d861c87faa24d071a83360431151c30","observation_id":"ba035bc8-4993-4dff-ac0f-280eacbe58e1","resolution":{"observed_at":"2026-08-04T15:22:54.415009Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.498886Z","title":"Learning to reason with LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.498886Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:5ed16f7427d832fd86943778e07f959ab58151438fce24199d84b59ecad772d3","observation_id":"f4d9de79-eb3e-4151-8588-b0e7e667031c","resolution":{"observed_at":"2026-08-04T15:22:54.498886Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.583556Z","title":"Reasoning models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.583556Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8e568b911099435b7cc6ea79d47dcb3b9d9ed5aabbc9ab8d617d73f587b8d8e7","observation_id":"00dd6d45-59b4-434d-bdba-bdad35b6d4d9","resolution":{"observed_at":"2026-08-04T15:22:54.583556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.689330Z","title":"Gemini thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.689330Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:56b0b5f6e56803341918bc56853ff727db3a24535bfaeb1a54022d2575ac7249","observation_id":"8fc9aca7-83dd-4247-8d85-cc1216172457","resolution":{"observed_at":"2026-08-04T15:22:54.689330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.764693Z","title":"Extended thinking","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.764693Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:04649263ef1809292477643fdd9e3047d6da7128b9fbb3bc32afcabffeb56d27","observation_id":"f2f15e35-9ecf-4171-b629-6090ef04fc9e","resolution":{"observed_at":"2026-08-04T15:22:54.764693Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.853124Z","title":"Detecting misbehavior in frontier reasoning models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.853124Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b34bb5d5ce95ae238eed4304700c6d5b9e36542863daedbb4cfe59d76ec5a977","observation_id":"8ee19f08-34c6-4dcc-902d-64bca9bf7e06","resolution":{"observed_at":"2026-08-04T15:22:54.853124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:54.926117Z","title":"Evaluating chain-of-thought monitorability","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:54.926117Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:c99fcc6d79e1ef0a21bfc6fac144e45e2856948c790ed1422f8f0cc206384540","observation_id":"8a84790b-1427-421b-8fef-1e05d624f26f","resolution":{"observed_at":"2026-08-04T15:22:54.926117Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.004805Z","title":"Weinberger","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.004805Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:dfb38cc621ad037a7e5c604a1e05d2f2a7b5d9e092b50d9b4ae76e3fc3a69730","observation_id":"1d31e4bc-575d-4e23-ae8b-65a98f9702fe","resolution":{"observed_at":"2026-08-04T15:22:55.004805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-06T08:34:11.887259Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2207.05221","snapshot_observed_at":"2026-08-04T15:22:55.096165Z","title":"Language models (mostly) know what they know.arXiv preprint arXiv:2207.05221, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.096165Z"},"links":{"cited_paper":"/paper/2207.05221","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:08bf422ce7a741480cc84a10c9e665ae20b157cc864105490563fd9bbef5e79e","observation_id":"e3830b88-790d-46b6-a444-51592cf03256","resolution":{"observed_at":"2026-08-04T15:22:55.096165Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.139696Z","title":"Discovering latent knowledge in language models without supervision","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.139696Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8d26f959c69a0d728a37cec46d487cd7e28ed07e6d9954115ad505f4f023b306","observation_id":"670ec74b-dca9-47c8-a921-a4b1b4dc5314","resolution":{"observed_at":"2026-08-04T15:22:55.139696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.232820Z","title":"The internal state of an LLM knows when it’s lying","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.232820Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e6494407674fb7cfc60c14cb5cfe9e8150dbb5ab71ff174561c3f5834cf2bb35","observation_id":"9a60e5fd-6ff8-4cf1-82f8-481d7bc715e7","resolution":{"observed_at":"2026-08-04T15:22:55.232820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.266444Z","title":"Qwen3 model collection","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.266444Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:94bbc506cb9574c6a0ecd113da0b4a93196386b3dae1c7a1ce3ebebc86129b82","observation_id":"f8de3072-45d2-49d5-bdb2-b18bc8598df4","resolution":{"observed_at":"2026-08-04T15:22:55.266444Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-04T15:22:55.340640Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.340640Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:45581af05e68d59e9f7832e75bd45d0ef417b246fc3b2b352fa376f549ce098d","observation_id":"fbf82d27-7fd1-43e1-a317-6855fc7398c7","resolution":{"observed_at":"2026-08-04T15:22:55.340640Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.479309Z","title":"Introducing gpt-oss","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.479309Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:922aa3604412c4cc27e7724cda43534f442887cbb9e3279a16f59bae2d65fa36","observation_id":"63c905e8-16e3-4985-928c-ab192a798ba0","resolution":{"observed_at":"2026-08-04T15:22:55.479309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-08-04T15:22:55.601332Z","title":"gpt-oss-120b & gpt-oss-20b model card.arXiv preprint arXiv:2508.10925, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.601332Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:54f180560309344a02cf32b488377e1d258b58ebce32a53e33157a72a081d279","observation_id":"fca9c4e1-5f2f-4d9f-b351-103c57a10434","resolution":{"observed_at":"2026-08-04T15:22:55.601332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.611081Z","title":"GPQA: A graduate-level Google-proof Q&A benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.611081Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:c86d516b773adcd0bd27db46659d5d806f82ee83a0768eb74ebc3dc260a6de71","observation_id":"39e291d4-6ebd-4712-9ce7-047c3036de32","resolution":{"observed_at":"2026-08-04T15:22:55.611081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.613881Z","title":"MMLU-Pro: A more robust and challenging multi-task language understand- ing benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.613881Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:3886f4b29e28b8e56cbf3dbc2edd95ec60f69dcea90f4cd38c81d33994310030","observation_id":"69d9e42c-34f4-49ef-a96f-d119cd9e6672","resolution":{"observed_at":"2026-08-04T15:22:55.613881Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.616785Z","title":"Benchmarks saturate when the model gets smarter than the judge.arXiv preprint arXiv:2601.19532, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.616785Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:96c92e2644f6b3b3759a6f9f044ad432ee2a2909eef0327829122fd76a249a7c","observation_id":"d26bead1-62ce-4b4b-9afc-07b0f2c4c903","resolution":{"observed_at":"2026-08-04T15:22:55.616785Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.619712Z","title":"Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.619712Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:b03234a72814e07039e899b22b79d9286e1d3e7881eaf15843321c2b506a9aff","observation_id":"69bd3f39-8981-4b20-963f-77b5d753461c","resolution":{"observed_at":"2026-08-04T15:22:55.619712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.622234Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.622234Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:c44a91fd7498ce79a7309f479ad1e787fc9c8fc6bbd51c765de2b9bdaa887a4d","observation_id":"9285d41e-9d1e-4e76-9931-60e05bacd976","resolution":{"observed_at":"2026-08-04T15:22:55.622234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T15:22:55.625115Z","title":"Training verifiers to solve math word problems.arXiv preprint arXiv:2110.14168, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.625115Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:f67b65eace6753ed9c97bd5e239018a2e742f14f7fb2c941e1a3a42565319bbf","observation_id":"dd54062b-bbea-4263-b1a7-d638b3788517","resolution":{"observed_at":"2026-08-04T15:22:55.625115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.627908Z","title":"Let’s verify step by step","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.627908Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:23995de4244859bbfe0f5947019294d4d0b1c8ea671e9589b8b7731267745cb9","observation_id":"4590fb20-cd6a-4419-9b69-45f05f9bd1b8","resolution":{"observed_at":"2026-08-04T15:22:55.627908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.630303Z","title":"The relationship between reasoning and performance in large language models–o3 (mini) thinks harder, not longer.Scientific Reports, 16, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.630303Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a45bb7793a5138d3456ba9bbd4a0fe7b8c3e8a241a12aee7ad90fe9361527f21","observation_id":"9b3ff758-276c-4af8-addb-b5a0e8efe634","resolution":{"observed_at":"2026-08-04T15:22:55.630303Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.13702","last_updated":"2023-07-17T01:08:39Z","snapshot_observed_at":"2026-07-31T04:21:27.501709Z","submitted_at":"2023-07-17T01:08:39Z","title":"Measuring Faithfulness in Chain-of-Thought Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.13702","snapshot_observed_at":"2026-08-04T15:22:55.632776Z","title":"Measuring faithfulness in chain-of-thought reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.632776Z"},"links":{"cited_paper":"/paper/2307.13702","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:697ec59231a8502f9673ebaf9a71db9c6d8eeb57a5e248a5ec6925afb1313231","observation_id":"bbe8b4e2-2a48-4e3a-b026-7ade65457f15","resolution":{"observed_at":"2026-08-04T15:22:55.632776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.635411Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.635411Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a2a58e04975614003cde681d63b43034003a6bf053a93c09687fca3d4c1a0a55","observation_id":"20c34a3c-1df0-497c-82f2-e95c5ac0b4f9","resolution":{"observed_at":"2026-08-04T15:22:55.635411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.638176Z","title":"Faithful chain-of-thought reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.638176Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:af95825a45040a547159f8bd5757d2826e2df233731bdd6726921008bcf2e04a","observation_id":"f5d986b2-c8e4-4cf2-8906-e615e3486f3c","resolution":{"observed_at":"2026-08-04T15:22:55.638176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.05410","last_updated":"2025-05-08T16:51:43Z","snapshot_observed_at":"2026-07-06T21:21:01.070459Z","submitted_at":"2025-05-08T16:51:43Z","title":"Reasoning Models Don't Always Say What They Think","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.05410","snapshot_observed_at":"2026-08-04T15:22:55.643430Z","title":"Reasoning models don’t always say what they think.arXiv preprint arXiv:2505.05410, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.643430Z"},"links":{"cited_paper":"/paper/2505.05410","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:514b3a75da4c9558db60441e58a54d9f222cf584362fd8d749492bd7530f21df","observation_id":"891febc3-c56d-4222-8264-e34320446d0f","resolution":{"observed_at":"2026-08-04T15:22:55.643430Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.646293Z","title":"MonitorBench: A comprehensive benchmark for chain-of-thought monitorability in large language models","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.646293Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:9879f9039e92767fc6341dc3f7740fa9b4d8911b297b3313157c834fd0fda76e","observation_id":"3bd74589-00ab-48b7-abdc-77fd4de9211d","resolution":{"observed_at":"2026-08-04T15:22:55.646293Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.648866Z","title":"Recent frontier models are reward hacking","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.648866Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:55dd9c88330db77c1a886179144d826e196a42b6e12fc9773ad7eae51e8fa429","observation_id":"20b9d831-1796-4841-996c-999c335b3812","resolution":{"observed_at":"2026-08-04T15:22:55.648866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.651357Z","title":"Zimmermann, David K","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.651357Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:ad860cda673b8c50e14454d82c7f2822b2f8166821fa202060b555bdcec5a0fa","observation_id":"8c240b39-bb8d-4940-955f-43cd49f44316","resolution":{"observed_at":"2026-08-04T15:22:55.651357Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.29192","last_updated":"2026-05-28T00:08:35Z","snapshot_observed_at":"2026-07-06T23:38:37.178378Z","submitted_at":"2026-05-28T00:08:35Z","title":"ReasonOps: Operator Segmentation for LLM Reasoning Traces","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.29192","snapshot_observed_at":"2026-08-04T15:22:55.653868Z","title":"ReasonOps: Operator segmentation for LLM reasoning traces, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.653868Z"},"links":{"cited_paper":"/paper/2605.29192","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8c5efcc087190ffbd1b31d4c6b699440085a0c101ba88e7176a630ffcefc4a97","observation_id":"0faacaec-9e86-4592-84f2-9481b9a78dd7","resolution":{"observed_at":"2026-08-04T15:22:55.653868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2607.09786","last_updated":"2026-08-02T18:21:10Z","snapshot_observed_at":"2026-08-07T05:12:04.880594Z","submitted_at":"2026-07-08T14:18:26Z","title":"Length Penalties Make Chain-of-Thought Less Monitorable","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.09786","snapshot_observed_at":"2026-08-04T15:22:55.656489Z","title":"Length penalties make chain-of-thought less monitorable, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.656489Z"},"links":{"cited_paper":"/paper/2607.09786","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e9dd99861c4e5720ca5062a57a24daf2cd69d9955fba2c8f7c750fc9629f7da5","observation_id":"6c431f89-a143-491d-b303-ff92ff1eb2f6","resolution":{"observed_at":"2026-08-04T15:22:55.656489Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.07267","last_updated":"2026-05-12T18:36:11Z","snapshot_observed_at":"2026-07-06T22:48:13.053749Z","submitted_at":"2026-03-07T15:50:44Z","title":"How to Steal Reasoning Without Reasoning Traces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.07267","snapshot_observed_at":"2026-08-04T15:22:55.659623Z","title":"Morris, and Vitaly Shmatikov","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.659623Z"},"links":{"cited_paper":"/paper/2603.07267","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:249dfb8e0ed7ade61364d8011db227c36d78c089d053718064460ad8038be688","observation_id":"ced02226-d5e1-4daf-9070-b8fb59ddb0a8","resolution":{"observed_at":"2026-08-04T15:22:55.659623Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.662254Z","title":"Measuring weak-to-strong legibility of reasoning models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.662254Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e53422a1398affcc026a11f37d5e1d28c0b75261d8d1ba9751c6dcbf61e78f0f","observation_id":"27b77f84-96c7-4573-a65a-68ff4c96956a","resolution":{"observed_at":"2026-08-04T15:22:55.662254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.668155Z","title":"Selective classification for deep neural networks","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.668155Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:66f00e5c6c0663932b1d1ae008faf53bd60d13a2bdfab7b03e43eea7ccf7b918","observation_id":"1e51d651-eda2-4133-ac24-a4090bbc8243","resolution":{"observed_at":"2026-08-04T15:22:55.668155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.670889Z","title":"Selective question answering under domain shift","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.670889Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:0540d735f8a365fd4696a6839c74e7dfb84cbd1f02e1a8fbc4d75ce214ae8585","observation_id":"2bbd4f15-5e8e-4dde-b0cd-b9aee3327416","resolution":{"observed_at":"2026-08-04T15:22:55.670889Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.673403Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.673403Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:d1a36b411b14e1b89f151e83414688e61cc733ffa06ef628a00dc91242bbdb9f","observation_id":"9137fcb8-3be6-43bf-8ec2-a59b6810b193","resolution":{"observed_at":"2026-08-04T15:22:55.673403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.676415Z","title":"Post-abstention: Towards reliably re-attempting the abstained instances in QA","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.676415Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:7c5643127d7b33df7f3a1d0c24118791ce3dd4598fc7c96503ed15f59a555325","observation_id":"d1ecc528-7dfe-4465-a29e-dcb142d04643","resolution":{"observed_at":"2026-08-04T15:22:55.676415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1610.01644","last_updated":"2018-11-22T23:40:00Z","snapshot_observed_at":"2026-07-06T05:13:30.860932Z","submitted_at":"2016-10-05T20:59:01Z","title":"Understanding intermediate layers using linear classifier probes","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1610.01644","snapshot_observed_at":"2026-08-04T15:22:55.678979Z","title":"Understanding intermediate layers using linear classifier probes.arXiv preprint arXiv:1610.01644, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.678979Z"},"links":{"cited_paper":"/paper/1610.01644","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:84d03d70a365db128e5a7ecea9bb14cbffc34587852fa7be69ff86ae4b6d8257","observation_id":"3c21d660-8403-4a1e-9477-6584cfbadd2a","resolution":{"observed_at":"2026-08-04T15:22:55.678979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.681893Z","title":"What you can cram into a single $&!#* vector: Probing sentence embeddings for linguistic properties","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.681893Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:74e00a5320a6a294763ea20de9a3b224d6bf9114ecf60696b249e9a4d9e98e6f","observation_id":"a5b3e427-3d92-40ff-857b-e043099550bd","resolution":{"observed_at":"2026-08-04T15:22:55.681893Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.684606Z","title":"Probing classifiers: Promises, shortcomings, and advances.Computational Linguistics, 48(1): 207–219, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.684606Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:217441a1dc0f9e52f5113c8b4e4047351037c508d086c8fb89496cd3956d19ad","observation_id":"e4c7eac5-c1a8-4b8c-866e-0237616497d1","resolution":{"observed_at":"2026-08-04T15:22:55.684606Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.687102Z","title":"The geometry of truth: Emergent linear structure in large language model representations of true/false datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.687102Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:0b367d4a2162a82c54353873d6372e77065bbc64dbeea5a105b188adbf60595d","observation_id":"51cf9d20-99a4-4bfa-856b-4a1a76cf83e3","resolution":{"observed_at":"2026-08-04T15:22:55.687102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01405","last_updated":"2025-03-03T06:14:14Z","snapshot_observed_at":"2026-07-06T16:26:38.284922Z","submitted_at":"2023-10-02T17:59:07Z","title":"Representation Engineering: A Top-Down Approach to AI Transparency","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01405","snapshot_observed_at":"2026-08-04T15:22:55.689628Z","title":"Byun, Zifan Wang, Alex Mallen, Steven Basart, Sanmi Koyejo, Dawn Song, Matt Fredrikson, Zico Kolter, and Dan Hendrycks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.689628Z"},"links":{"cited_paper":"/paper/2310.01405","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:347af77847b8054d1c2995b7c994b62340d68077e7ed7f6f4866b439c6d5269d","observation_id":"5dbfacce-095a-4e25-a322-d302c24fd408","resolution":{"observed_at":"2026-08-04T15:22:55.689628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.05488","last_updated":"2026-05-28T15:25:50Z","snapshot_observed_at":"2026-07-15T14:29:32.870267Z","submitted_at":"2026-03-05T18:55:16Z","title":"Reasoning Theater: Disentangling Model Beliefs from Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.05488","snapshot_observed_at":"2026-08-04T15:22:55.692309Z","title":"Reasoning theater: Disentangling model beliefs from chain-of-thought, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.692309Z"},"links":{"cited_paper":"/paper/2603.05488","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:65220c60c82aef4728433104104f4997173453f11700570174e6a91a0169169a","observation_id":"6fc31e30-c431-4330-9f14-5a07614571ab","resolution":{"observed_at":"2026-08-04T15:22:55.692309Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.694887Z","title":"Catching rationalization in the act: Detecting motivated reasoning before and after CoT via activation probing","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.694887Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:6dce6715259ab85a0cfc98df0ef9cd2a92529843571e74d16cf615a56b448041","observation_id":"128f845d-abca-4eb0-8cff-572e2d44cd27","resolution":{"observed_at":"2026-08-04T15:22:55.694887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.697699Z","title":"Can LLMs predict their own failures? self-awareness via internal circuits,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.697699Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:c985236bdbe81614ebf07b1d136b064db0c1906b5e946102855fa82048366d81","observation_id":"553a984d-8060-496d-b3fb-d9e8d817bdaf","resolution":{"observed_at":"2026-08-04T15:22:55.697699Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.703232Z","title":null,"venue":null,"work_id":null,"year":1953},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.703232Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e17e3003c3590c34c189c75e09c7749c67cebb807f4779e62a719ddb8cad5493","observation_id":"1fb32995-7a31-4b13-bee8-d60196feb79b","resolution":{"observed_at":"2026-08-04T15:22:55.703232Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.15842","last_updated":"2025-08-19T18:20:38Z","snapshot_observed_at":"2026-08-07T08:36:52.541508Z","submitted_at":"2025-08-19T18:20:38Z","title":"Lexical Hints of Accuracy in LLM Reasoning Chains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.15842","snapshot_observed_at":"2026-08-04T15:22:55.705722Z","title":"Lexical hints of accuracy in LLM reasoning chains.arXiv preprint arXiv:2508.15842, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.705722Z"},"links":{"cited_paper":"/paper/2508.15842","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:5b72c245afc36a28b2ee4d20088685e8aa985c1a0204f685776274e57ec0db0d","observation_id":"7fa0ea57-4e87-4d6d-ab0a-7fa9a9957c7a","resolution":{"observed_at":"2026-08-04T15:22:55.705722Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.708609Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT-networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.708609Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:903f9ae08730dc7dec309c7eb478424f2b33e84a67e82309252094326a2732e2","observation_id":"f50feb57-7cfa-40dc-b940-c4f52dfef437","resolution":{"observed_at":"2026-08-04T15:22:55.708609Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.711440Z","title":"Cohere’s embed models: details and application","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.711440Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:dcf85e77897a7005fe79abb6e58daf67473cd20ad00fb903088bb06bf97980f2","observation_id":"55d4a926-5ff9-411e-8ea0-cd4757ef639c","resolution":{"observed_at":"2026-08-04T15:22:55.711440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.717254Z","title":"Bag of tricks for efficient text classification","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.717254Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:cbb9b9c2557fba5eff99fe01487b52453b4b19fe8d2a2d3d8335919bd99fea43","observation_id":"e09c6ee7-226e-4fb6-9f28-dd3a366f1009","resolution":{"observed_at":"2026-08-04T15:22:55.717254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.11055","last_updated":"2022-09-22T14:48:11Z","snapshot_observed_at":"2026-08-05T06:29:33.316428Z","submitted_at":"2022-09-22T14:48:11Z","title":"Efficient Few-Shot Learning Without Prompts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.11055","snapshot_observed_at":"2026-08-04T15:22:55.720055Z","title":"Efficient few-shot learning without prompts, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.720055Z"},"links":{"cited_paper":"/paper/2209.11055","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:cf7dcbbdef58c52f32b24ecf2ac8a3a1a6f9863a0863a907524275031f9ae418","observation_id":"b31ef1b5-be68-4428-9359-8161787a2b71","resolution":{"observed_at":"2026-08-04T15:22:55.720055Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.722875Z","title":"Ma- tryoshka representation learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.722875Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a40c852e8df347f2a134c44598f719ae61dea19b394a26cee9f614e5ecf58629","observation_id":"023b3a8f-f40a-4cfa-b264-9767a7fd109c","resolution":{"observed_at":"2026-08-04T15:22:55.722875Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.714464Z","title":"Accessed 2026-05-12","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.714464Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:e19e07fd1ac413148749008e792bf67ac39c844a0d683c5f33a04c02acb49d0d","observation_id":"9f456af3-86a9-40a0-a709-5e0595d9c956","resolution":{"observed_at":"2026-08-04T15:22:55.714464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.728237Z","title":"Task prompt:","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.728237Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8f571cfeb4e1cab8aa2dbe5e12512d496745b5413dedfc4e8e20160e04c98cf2","observation_id":"8a3d63aa-70c5-43bc-afc0-142966bf912a","resolution":{"observed_at":"2026-08-04T15:22:55.728237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.725637Z","title":"Cohere Embed v4 model parameters for Amazon Bedrock.https://docs.aws.amazon","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.725637Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:3c9ffd6eb8ca5bf5fedcabc6bfbb03e3a6cc5777553069eb5283b9ae0c142e45","observation_id":"dc37a3c5-5168-4efe-9585-d90f0ea45894","resolution":{"observed_at":"2026-08-04T15:22:55.725637Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.640919Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.640919Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:97ecd4d0a4ea18cdcc510b6785744ee2c56452c0ada56809cd53f10caa27173a","observation_id":"73985422-df85-4de7-a118-8b29d80e8f3c","resolution":{"observed_at":"2026-08-04T15:22:55.640919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T15:22:55.700408Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.700408Z"},"links":{"citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:8688e32346474585d446c014a2f24fdab0ad22d667f88dd3355ce331be231ca6","observation_id":"b310046e-0b9c-4079-8694-d3b6bee995cd","resolution":{"observed_at":"2026-08-04T15:22:55.700408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.20508","last_updated":"2026-06-02T07:42:23Z","snapshot_observed_at":"2026-08-03T02:31:08.820508Z","submitted_at":"2026-03-20T21:23:29Z","title":"Measuring Weak-to-Strong Legibility of Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.20508","snapshot_observed_at":"2026-08-04T15:22:55.664897Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-04T15:22:55.664897Z"},"links":{"cited_paper":"/paper/2603.20508","citing_paper":"/paper/2608.02089"},"observation_digest":"sha256:a78223886e0115d2b4546b0688a943243de6c8f6ba7f5c171647ddb7d0a221c7","observation_id":"4a502dba-f086-44ab-a5fb-40a1dea5224f","resolution":{"observed_at":"2026-08-04T15:22:55.664897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2608.02089","last_updated":"2026-08-03T11:48:39Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-06T23:36:52.716922Z","submitted_at":"2026-08-03T11:48:39Z","title":"How Much Does a Reasoning Summary Reveal? An Observability Ladder for Large Language Models"},"reference_resolution":{"displayed":61,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":61},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 61 of 61 outbound references and 0 inbound Pith citation observations for arXiv:2608.02089."}