{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2025:YCTWFAE4BTXFKJMBJ5UIYGYGXC","short_pith_number":"pith:YCTWFAE4","schema_version":"1.0","canonical_sha256":"c0a762809c0cee5525814f688c1b06b8a4f26610c93000ab1b100cf3f5c1c43b","source":{"kind":"arxiv","id":"2506.04907","version":4},"attestation_state":"computed","paper":{"title":"Context Is Not Comprehension","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Alex Pan, Mary-Anne Williams","submitted_at":"2025-06-05T11:41:05Z","abstract_excerpt":"The dominant way of judging Large Language Models (LLMs) has been to ask how well they can recall explicit facts from very long inputs. While today's best models achieve near perfect recall, this masks a harder skill: performing multi-step reasoning and tracking intermediate state that never appears verbatim. We introduce Verbose ListOps (VLO), a benchmark that embeds deterministic ListOps computations inside narrative camouflage and, crucially, allows step-level evaluation of every intermediate result. Experiments show that models which solve raw ListOps with approximately 100% accuracy colla"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2506.04907","kind":"arxiv","version":4},"metadata":{"license":"http://creativecommons.org/licenses/by/4.0/","primary_cat":"cs.CL","submitted_at":"2025-06-05T11:41:05Z","cross_cats_sorted":["cs.AI","cs.IR","cs.LG"],"title_canon_sha256":"12cdfd1419e0db580bb57deb719963bde474154927a4fb24eb030608cd0bbc47","abstract_canon_sha256":"c50c3406b60dca328e66238f0b7e3ee5776437d7fe560fa95f0e40ee8870ff29"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T11:20:12.996216Z","signature_b64":"OXjePd5jjk8XiO7Aan73wsx/yUVYiiaEPC5JS0WuAYv1ff6SdZwb3i8crDFP2CJeBXPJXnMol5qa1UrxRFDSAw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"c0a762809c0cee5525814f688c1b06b8a4f26610c93000ab1b100cf3f5c1c43b","last_reissued_at":"2026-07-05T11:20:12.995801Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T11:20:12.995801Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"Context Is Not Comprehension","license":"http://creativecommons.org/licenses/by/4.0/","headline":"","cross_cats":["cs.AI","cs.IR","cs.LG"],"primary_cat":"cs.CL","authors_text":"Alex Pan, Mary-Anne Williams","submitted_at":"2025-06-05T11:41:05Z","abstract_excerpt":"The dominant way of judging Large Language Models (LLMs) has been to ask how well they can recall explicit facts from very long inputs. While today's best models achieve near perfect recall, this masks a harder skill: performing multi-step reasoning and tracking intermediate state that never appears verbatim. We introduce Verbose ListOps (VLO), a benchmark that embeds deterministic ListOps computations inside narrative camouflage and, crucially, allows step-level evaluation of every intermediate result. Experiments show that models which solve raw ListOps with approximately 100% accuracy colla"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2506.04907","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2506.04907/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2506.04907","created_at":"2026-07-05T11:20:12.995857+00:00"},{"alias_kind":"arxiv_version","alias_value":"2506.04907v4","created_at":"2026-07-05T11:20:12.995857+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2506.04907","created_at":"2026-07-05T11:20:12.995857+00:00"},{"alias_kind":"pith_short_12","alias_value":"YCTWFAE4BTXF","created_at":"2026-07-05T11:20:12.995857+00:00"},{"alias_kind":"pith_short_16","alias_value":"YCTWFAE4BTXFKJMB","created_at":"2026-07-05T11:20:12.995857+00:00"},{"alias_kind":"pith_short_8","alias_value":"YCTWFAE4","created_at":"2026-07-05T11:20:12.995857+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":0,"internal_anchor_count":0,"sample":[]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC","json":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC.json","graph_json":"https://pith.science/api/pith-number/YCTWFAE4BTXFKJMBJ5UIYGYGXC/graph.json","events_json":"https://pith.science/api/pith-number/YCTWFAE4BTXFKJMBJ5UIYGYGXC/events.json","paper":"https://pith.science/paper/YCTWFAE4"},"agent_actions":{"view_html":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC","download_json":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC.json","view_paper":"https://pith.science/paper/YCTWFAE4","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2506.04907&json=true","fetch_graph":"https://pith.science/api/pith-number/YCTWFAE4BTXFKJMBJ5UIYGYGXC/graph.json","fetch_events":"https://pith.science/api/pith-number/YCTWFAE4BTXFKJMBJ5UIYGYGXC/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC/action/timestamp_anchor","attest_storage":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC/action/storage_attestation","attest_author":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC/action/author_attestation","sign_citation":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC/action/citation_signature","submit_replication":"https://pith.science/pith/YCTWFAE4BTXFKJMBJ5UIYGYGXC/action/replication_record"}},"created_at":"2026-07-05T11:20:12.995857+00:00","updated_at":"2026-07-05T11:20:12.995857+00:00"}