{"as_of":"2026-08-08T19:00:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:01985ae3cfb53b4dd2f4a47ebab50c8b3afeced57e374ca96ae7c6dba93bc56c","coverage":[{"denominator":39,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":39,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T11:46:27.690613Z","state":"measured"},{"denominator":39,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":39,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2507.22411/citation-record","integrity":"/paper/2507.22411/integrity","json":"/paper/2507.22411/citation-record.json","paper":"/paper/2507.22411"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.496364Z","title":"L -eval: Instituting standardized evaluation for long context language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.496364Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:697ae41c5f203d1a881574dfa24adbce1f385cdf7568e63030067341eec866f0","observation_id":"06c60503-8b14-4bb6-8ee8-de3c0d9b0744","resolution":{"observed_at":"2026-08-06T11:46:27.496364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18745","last_updated":"2024-10-24T13:51:50Z","snapshot_observed_at":"2026-08-06T10:59:31.363202Z","submitted_at":"2024-10-24T13:51:50Z","title":"Why Does the Effective Context Length of LLMs Fall Short?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18745","snapshot_observed_at":"2026-08-06T11:46:27.504905Z","title":"Why does the effective context length of llms fall short? arXiv preprint arXiv:2410.18745, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.504905Z"},"links":{"cited_paper":"/paper/2410.18745","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:8268e706fc51859e14a3dd4b48208a09fbc2846de1a14b5621a91874468f860a","observation_id":"6705ba03-5846-494e-b84d-59c35f98ae6b","resolution":{"observed_at":"2026-08-06T11:46:27.504905Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.511602Z","title":"L ong B ench: A bilingual, multitask benchmark for long context understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.511602Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:a79565a3673c5ae0762a00070a75239b915cc405a7d61a4ff9b5eebf76bb7368","observation_id":"0d49ffe9-54d1-4eb0-8f97-585cb830a97e","resolution":{"observed_at":"2026-08-06T11:46:27.511602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.521771Z","title":"Lost in the haystack: Smaller needles are more difficult for llms to find","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.521771Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:f72c7178cbc6e36c1571d9c069999cc17bc5101587461f5d209866e50e273086","observation_id":"828392cb-c7af-4d80-94da-ee230c7bd4c0","resolution":{"observed_at":"2026-08-06T11:46:27.521771Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.907774Z","title":"Longrope: extending llm context window beyond 2 million tokens","venue":null,"work_id":"dd91f843-b927-4ab4-a037-a8cd7843913e","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.528889Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:4df802bc930d3ac198c8367c674c8db94c657f1d608b6987bffc421113af0bd7","observation_id":"f9b5b160-22e3-4aa3-ac54-f185959fde41","resolution":{"observed_at":"2026-08-06T11:46:30.011348Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.769191Z","title":"Robinson, Keren Gu, Anna-Luisa Brakman, Pamela Mishkin, Meghan Shah, Johannes Heidecke, Lilian Weng, and Adam Tauman Kalai","venue":null,"work_id":"3ed88159-b9fe-4761-b069-074407cf4b82","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.535284Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:cce5270cdc81bc1c18294b366abf23f8e554b5fa12b6752b0d9c2263b893098a","observation_id":"e7c47c35-0e6b-4924-97db-9975f380f9ff","resolution":{"observed_at":"2026-08-06T11:46:29.819422Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.661857Z","title":"A little goes a long way: Efficient long context training and inference with partial contexts","venue":null,"work_id":"c109864e-812f-4ee9-ae3f-9f144888393d","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.540076Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:03238726905333fa93894c1832ce1277bed71564181388023f14080f92c2ebae","observation_id":"85064a81-8709-48d6-8bbf-ed26bf4b26d8","resolution":{"observed_at":"2026-08-06T11:46:29.723407Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-06T11:46:27.544539Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.544539Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:64031294353a7d043ee0756c24c4310175b4ae95b72b218e21adc732aed430fb","observation_id":"dbe909cd-9916-41f0-a0a4-99660e694531","resolution":{"observed_at":"2026-08-06T11:46:27.544539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.549449Z","title":"RULER : What s the real context size of your long-context language models? In First Conference on Language Modeling, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.549449Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:6860f973b72663a18eb0e534712d9238de70c498303eef78acfb2e1f1a9b5b81","observation_id":"fafd8105-793c-48ff-a563-0cc581de2123","resolution":{"observed_at":"2026-08-06T11:46:27.549449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T11:46:27.553003Z","title":"Gpt-4o system card","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.553003Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:b207dd3b52887b93744150e28fe81f27154d967731305141e51cbe61e2a5cf32","observation_id":"d01add48-d443-4b30-8a68-8236896c9903","resolution":{"observed_at":"2026-08-06T11:46:27.553003Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.541308Z","title":"Llm maybe longlm: Selfextend llm context window without tuning","venue":null,"work_id":"8878b2f2-e270-43b9-a4f8-51803d530a01","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.557438Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:902f18a6c5e424e20112542ef2bdbd4cd1c86bdf2d2e75dbeb9fcf77b62852d5","observation_id":"5bd5ee6b-52da-4fa4-ad8f-8ca1d8b9db28","resolution":{"observed_at":"2026-08-06T11:46:29.582898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.376889Z","title":"Babilong: Testing the limits of llms with long context reasoning-in-a-haystack","venue":null,"work_id":"b784d014-5a63-4bd4-bebb-9d50aaa00d1c","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.561275Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:ff86046e0fb5c331a7a51dded47615d5580ef5edd67beb77ae9e5beefece2de9","observation_id":"036587d2-ef5d-4365-be44-8c051fdd258c","resolution":{"observed_at":"2026-08-06T11:46:29.438687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.566070Z","title":"Efficient memory management for large language model serving with pagedattention","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.566070Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:7f1504fed05771908e4cd9731ddfa6146ba1111bf83a57b9cc33e4821784ff13","observation_id":"3d7013a5-3ff9-46b1-bf89-dd6fe1a282e5","resolution":{"observed_at":"2026-08-06T11:46:27.566070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.217549Z","title":"Summary of a haystack: A challenge to long-context llms and rag systems","venue":null,"work_id":"820ae731-fcbc-49d7-bc34-8be4834ca14c","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.569796Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:253e598ae0a98454f80da1fd4e88d2a677122c2f172bab19008892aa21e3174b","observation_id":"d3716063-93bb-4964-a404-3f4fec1d63ba","resolution":{"observed_at":"2026-08-06T11:46:29.276786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.573684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.573684Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:aab5282be3af903c63001b451008c414eeb7fd6ee98aff01dfade70dd4600474","observation_id":"cfca3c99-9896-42a2-a3ef-ea2e42b3d7bd","resolution":{"observed_at":"2026-08-06T11:46:27.573684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.578298Z","title":"Needlebench: Can llms do retrieval and reasoning in 1 million context window? arXiv preprint arXiv:2407.11963, 2024 b","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.578298Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:008aa57906cdecef12148e23f68b45c23a2ece8cf8c745e29eb3232beee69cb7","observation_id":"63b56fc7-333b-4e53-ac73-935f888ff4aa","resolution":{"observed_at":"2026-08-06T11:46:27.578298Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.583360Z","title":"MARIO : MA th reasoning with code interpreter output - a reproducible pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.583360Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:ce900b09448278baacfe3a330f9890f690fe3ec8eae202a1135ed87ecbfbbee4","observation_id":"522563eb-6d57-4c54-a6be-7c4bcbd31790","resolution":{"observed_at":"2026-08-06T11:46:27.583360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T11:46:27.588726Z","title":"Deepseek-v3 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.588726Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:c5ef268f4d0ba8a1160e3e0a83fb65039c6726077c4099ddf9218aa10b6e5659","observation_id":"cf94dfeb-a0f7-4c58-a42f-4f747c5f917d","resolution":{"observed_at":"2026-08-06T11:46:27.588726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:29.077634Z","title":"Lost in the middle: How language models use long contexts","venue":null,"work_id":"b1620ef7-c176-4eb1-a22d-fcaf71adb9c5","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.594037Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:fc8483bfb8e8b3bce51b2fb9b398d6d26c48b2e571a4775211a36f374b6faa8f","observation_id":"05a0efc1-82cd-4def-9a61-b1d2f81b6207","resolution":{"observed_at":"2026-08-06T11:46:29.130444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:28.964980Z","title":"The llama 4 herd: The beginning of a new era of natively multimodal ai innovation","venue":null,"work_id":"fe51990d-378a-4e73-9b1c-55b247151392","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.599895Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:a82363a98cff9ef748ffc59fbc3a0f7008eb9220fe1213490ad817dcd1576b8c","observation_id":"34b04707-0861-4270-805c-30383b7df666","resolution":{"observed_at":"2026-08-06T11:46:29.016266Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.605394Z","title":"Ya RN : Efficient context window extension of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.605394Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:e8d71709b3cabb3c79ac9caac54460cff72419ab0c392ea353fc73f3c5fcf0a5","observation_id":"654112ab-d448-4106-9f0f-60c86e5bb4f2","resolution":{"observed_at":"2026-08-06T11:46:27.605394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:28.838436Z","title":"o ring, and Julius Tr \\","venue":null,"work_id":"6046ebcf-73a4-4faf-8bab-eddbe79f20d1","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.610172Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:083438037726b15cf7080f49dbe106efb0a5eebb2c2d55d0c8a1393a3db639ba","observation_id":"f15e1a9e-cbb7-4de4-8082-a7cba26892b7","resolution":{"observed_at":"2026-08-06T11:46:28.890627Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2025.findings-naacl.410","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.730115Z","title":"G eo C oder: Solving geometry problems by generating modular code through vision-language models","venue":null,"work_id":"767d247f-d3cc-48fe-8525-5cd3d5dc5411","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.614489Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:bb288fd75e892ec5083c66d5f2424cf6dd921e3ed6181f7127087063093e64b8","observation_id":"4d393cd8-b644-4cf8-8f21-7d5f9c4983bd","resolution":{"observed_at":"2026-08-06T11:46:27.736328Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:28.668189Z","title":"Counting-stars: A multi-evidence, position-aware, and scalable benchmark for evaluating long-context large language models","venue":null,"work_id":"e27437c1-c93c-49fe-9c75-3c2d496b3b57","year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.618520Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:f8ba08059fbd96b950d693770846cf24e777b067c048b7d8470e7191f0eb1f8c","observation_id":"4c602030-6238-457c-a450-0f5b6b115e8f","resolution":{"observed_at":"2026-08-06T11:46:28.761262Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-06T11:46:27.622443Z","title":"Gemma 3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.622443Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:2c78507c74bfe3c2cb4b333951bf8119b8bc86acd066441d4ec2f58952b73c5b","observation_id":"e333c5d0-ee7e-4b50-9ac6-b73ee2f45e6b","resolution":{"observed_at":"2026-08-06T11:46:27.622443Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.627010Z","title":"Qwq-32b: Embracing the power of reinforcement learning, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.627010Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:57c3c320aeac0f5663430efc9d628521574fcbbfefb4a89d1038f9849ec1f3da","observation_id":"c83896ea-3553-4513-a4a9-d68fc873aa95","resolution":{"observed_at":"2026-08-06T11:46:27.627010Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T11:46:27.631026Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.631026Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:13d34972c11c3803d17cdee947e4c3b64f6f20a7cb159d4e5c3838b2194039ee","observation_id":"ffe97308-7504-44dc-925e-23f1cfda8f71","resolution":{"observed_at":"2026-08-06T11:46:27.631026Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:28.483960Z","title":"Focused transformer: Contrastive training for context scaling","venue":null,"work_id":"dd0bbea6-f223-47c8-9750-65170065bf07","year":2023},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.636394Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:0cc6d5adfb2e41ce18ef4d780e436518a2b921ef3d7bc745cbd0f082396f0b66","observation_id":"e9144b23-141c-406c-bca0-736ba4a2905c","resolution":{"observed_at":"2026-08-06T11:46:28.569233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:28.273840Z","title":"Needle in a multimodal haystack","venue":null,"work_id":"6ee66cd0-7b4b-4271-8a02-088b4fb465a5","year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.640563Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:aeb9bb09f2dc16cc45ced7c5f956871ec2e1524414705f3d33ae41c6a64f02d8","observation_id":"7bb3c8db-7d2c-4260-b2ef-d648aaa7a923","resolution":{"observed_at":"2026-08-06T11:46:28.377927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.644477Z","title":"Transformers: State-of-the-art natural language processing","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.644477Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:643bf9713b5e73edf04a990166f56b336a98ceabeaa830912a6409057afba6b9","observation_id":"4e8a3c6f-08f0-4d1a-85e7-4503d2cc7f49","resolution":{"observed_at":"2026-08-06T11:46:27.644477Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T11:46:27.648103Z","title":"Qwen2.5 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.648103Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:83ba363621707dd8fd1b849a92e0b9e85ee81623ffdb610d89d16d4b446e411d","observation_id":"d2ccb463-1a52-473d-86e5-75f84a56734b","resolution":{"observed_at":"2026-08-06T11:46:27.648103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-06T11:46:27.652320Z","title":"Qwen3 technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.652320Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:93cc44eb60f25a335fd6f69dda73a20969467b305971f823a443732cf557efac","observation_id":"af51c293-28e1-4759-b51a-8e37ff4afe55","resolution":{"observed_at":"2026-08-06T11:46:27.652320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.15383","last_updated":"2025-01-26T03:47:25Z","snapshot_observed_at":"2026-07-31T01:49:29.562668Z","submitted_at":"2025-01-26T03:47:25Z","title":"Qwen2.5-1M Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.15383","snapshot_observed_at":"2026-08-06T11:46:27.658253Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.658253Z"},"links":{"cited_paper":"/paper/2501.15383","citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:efc262b55ff8df9fb72f2ce15e9ca381365c2c7cbfd58ab4d6084979b7470106","observation_id":"74fd94d5-9007-46ef-a4ca-df8740aed517","resolution":{"observed_at":"2026-08-06T11:46:27.658253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.663661Z","title":"Sequential-niah: A needle-in-a-haystack benchmark for extracting sequential needles from long contexts","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.663661Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:b1ab576aa7387af9779bd4225978697a43d071376f4f73394be3fdf6f26ef7ef","observation_id":"8559064b-2315-4680-8853-a03504f67425","resolution":{"observed_at":"2026-08-06T11:46:27.663661Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.668143Z","title":"B ench: Extending long context evaluation beyond 100 K tokens","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.668143Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:eea5cd8e0d88315eafcef0ff3912a955bd28c0fdce87455417dcaa6ed40a17c3","observation_id":"e288130a-9477-44aa-8fe4-4c0d804077bc","resolution":{"observed_at":"2026-08-06T11:46:27.668143Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.675184Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.675184Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:4ac5ffc657ff60592e96923f9b3f82377bb7a05e44da1fa3359d9d1eb50dd0d3","observation_id":"f2984a17-bc41-403c-857b-58a98bdab347","resolution":{"observed_at":"2026-08-06T11:46:27.675184Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.681160Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.681160Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:4995d7d6825b747cedf35cbc527dae7171ebcfee9c61b15810baed9e0a79b4e0","observation_id":"b353e21d-8a58-4bd4-be83-64542fdf0e0b","resolution":{"observed_at":"2026-08-06T11:46:27.681160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.686304Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.686304Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:dd0d01d58ed84ca4cc5a6ddfdab71ed54db8382ac17bdd763a1cf225f093d023","observation_id":"90a33ccb-bd36-4710-82e5-3efc165e196e","resolution":{"observed_at":"2026-08-06T11:46:27.686304Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T11:46:27.690613Z","title":"ROPE Contraction","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T11:46:27.690613Z"},"links":{"citing_paper":"/paper/2507.22411"},"observation_digest":"sha256:80ff5fd6d6d4941180a49de691d6142852d283e1ad44f606b58739224f5882f3","observation_id":"2661babe-2179-4fb7-b73e-f640903c2a28","resolution":{"observed_at":"2026-08-06T11:46:27.690613Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2507.22411","last_updated":"2026-06-20T07:40:02Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T11:46:25.999796Z","submitted_at":"2025-07-30T06:29:50Z","title":"NeedleChain: Measuring Intact Context Comprehension Capability of Large Language Models"},"reference_resolution":{"displayed":39,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":1,"verified_fuzzy":12},"total_outbound_references":39},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 39 of 39 outbound references and 0 inbound Pith citation observations for arXiv:2507.22411."}