{"as_of":"2026-08-09T19:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:1921165d7bc719e8ff28a19dc2166d6b2d29f87d8341150cdc6c390e38b6b58e","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T18:34:26.820347Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T15:36:26.867470Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T13:54:44.144191Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.07813","snapshot_observed_at":"2026-08-07T15:36:26.867470Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.14552","last_updated":"2025-05-21T07:43:57Z","snapshot_observed_at":"2026-08-09T08:47:24.549169Z","submitted_at":"2025-05-20T16:06:32Z","title":"KORGym: A Dynamic Game Platform for LLM Reasoning Evaluation","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T15:36:26.867470Z"},"links":{"cited_paper":"/paper/2502.07813","citing_paper":"/paper/2505.14552"},"observation_digest":"sha256:9711bb025368251b1227b74545c63ad0d8ff218b0ce4dc36ef04dac99b32d166","observation_id":"21535db2-bb2d-4c3f-a2ec-3be81e92849b","resolution":{"observed_at":"2026-08-07T15:36:26.867470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"cited_work":{"arxiv_id":"2502.07813","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2502.07813","snapshot_observed_at":"2026-06-30T13:54:44.144191Z","title":"Cryptox: Compositional reasoning evaluation of large language models.arXiv preprint arXiv:2502.07813,","venue":null,"work_id":"2468d56b-e5c7-4e39-87c1-51184b299171","year":null},"citing_paper":{"arxiv_id":"2605.24414","last_updated":"2026-05-23T05:57:30Z","snapshot_observed_at":"2026-08-08T12:13:53.897636Z","submitted_at":"2026-05-23T05:57:30Z","title":"JT-SAFE-V2: Safety-by-Design Foundation Model with World-Context Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T13:45:38.305767Z"},"links":{"cited_paper":"/paper/2502.07813","citing_paper":"/paper/2605.24414"},"observation_digest":"sha256:b3c0fa4fb963d3caaf7abdeeef30b03494ea584fae9ba04affd16034a1516f63","observation_id":"e24ea313-392a-407b-8bb5-786d85133471","resolution":{"observed_at":"2026-06-30T13:54:44.146308Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2502.07813/citation-record","integrity":"/paper/2502.07813/integrity","json":"/paper/2502.07813/citation-record.json","paper":"/paper/2502.07813"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-08T18:34:26.701322Z","title":"Cobbe, V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.701322Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:be77285c387f042427f73f18c581bfa5fab26872e2d0afbdbad56529ac875a52","observation_id":"ccb7eefd-a373-4959-8053-d187c253a598","resolution":{"observed_at":"2026-08-08T18:34:26.701322Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.314754Z","title":null,"venue":null,"work_id":"22d2532d-614f-4538-b050-377a6ad3d7ea","year":2000},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.817457Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:65e7338dcb051267343880ac3b95a0346d0439c11f4bc7991c84dfbddd91f294","observation_id":"2681304e-4f9d-45bd-a739-a3b6aa88da22","resolution":{"observed_at":"2026-08-08T18:34:27.318246Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.06102","last_updated":"2024-06-06T22:59:58Z","snapshot_observed_at":"2026-08-08T01:23:42.996552Z","submitted_at":"2024-01-11T18:33:48Z","title":"Patchscopes: A Unifying Framework for Inspecting Hidden Representations of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.06102","snapshot_observed_at":"2026-08-08T18:34:26.709405Z","title":"Ghandeharioun, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.709405Z"},"links":{"cited_paper":"/paper/2401.06102","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:095f3978ddeacd42b3bc4980edf1ae6498cbfa80261a71d456e5cec92594a483","observation_id":"4d60f8ba-7cfb-405e-99b6-77643daf5c7a","resolution":{"observed_at":"2026-08-08T18:34:26.709405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.15778","last_updated":"2024-10-12T11:00:25Z","snapshot_observed_at":"2026-07-06T19:07:07.234443Z","submitted_at":"2024-08-28T13:16:41Z","title":"LogicGame: Benchmarking Rule-Based Reasoning Abilities of Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.15778","snapshot_observed_at":"2026-08-08T18:34:26.713246Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.713246Z"},"links":{"cited_paper":"/paper/2408.15778","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:d312cd52b88d1b41d34014f5e8a7d1264b7d448b6c28252a1c4a09c014ae3634","observation_id":"05336bf8-4c47-4db1-8a32-1b9d12459245","resolution":{"observed_at":"2026-08-08T18:34:26.713246Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.00840","last_updated":"2024-10-11T20:08:54Z","snapshot_observed_at":"2026-08-09T17:25:13.891240Z","submitted_at":"2022-09-02T06:50:11Z","title":"FOLIO: Natural Language Reasoning with First-Order Logic","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.00840","snapshot_observed_at":"2026-08-08T18:34:26.717301Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.717301Z"},"links":{"cited_paper":"/paper/2209.00840","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:7eb2d72f39533223ae7f2a938b22f8ceec053431e638a183bdf3a7d910ac79d1","observation_id":"25176236-cd10-4602-85f3-52cccce66007","resolution":{"observed_at":"2026-08-08T18:34:26.717301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-09T10:28:06.906299Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-08T18:34:26.720730Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.720730Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:076f07aa276a08602f191d22fd7d355e1c86ab4a1f3ce78dc5da5eb51219225b","observation_id":"805903e1-86c1-4771-abe9-5859b9512c9c","resolution":{"observed_at":"2026-08-08T18:34:26.720730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12570","last_updated":"2024-08-22T17:38:59Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:38:59Z","title":"Jamba-1.5: Hybrid Transformer-Mamba Models at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12570","snapshot_observed_at":"2026-08-08T18:34:26.735307Z","title":"doi: 10.18653/v1/2023.emnlp-main.299","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.735307Z"},"links":{"cited_paper":"/paper/2408.12570","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:524d5fa0309e1807896fbc075bf54c56d56079c775ab4b9993fcd895f63981ef","observation_id":"84af3a71-7359-4ca4-b4e7-e7c83c596b4c","resolution":{"observed_at":"2026-08-08T18:34:26.735307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.12570","last_updated":"2024-08-22T17:38:59Z","snapshot_observed_at":"2026-07-06T19:04:43.716629Z","submitted_at":"2024-08-22T17:38:59Z","title":"Jamba-1.5: Hybrid Transformer-Mamba Models at Scale","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.12570","snapshot_observed_at":"2026-08-08T18:34:26.738811Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.738811Z"},"links":{"cited_paper":"/paper/2408.12570","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:8e9cc637f33efc2b23acc8acc35fd98cc30dcd0b354865fe1e61e7af74635a44","observation_id":"ab3a0cd4-2022-4d65-9e2f-96e067fe4eb5","resolution":{"observed_at":"2026-08-08T18:34:26.738811Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14328","last_updated":"2024-06-06T14:06:41Z","snapshot_observed_at":"2026-07-06T17:33:50.525062Z","submitted_at":"2024-02-22T06:47:56Z","title":"Understanding and Patching Compositional Reasoning in LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14328","snapshot_observed_at":"2026-08-08T18:34:26.742368Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.742368Z"},"links":{"cited_paper":"/paper/2402.14328","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:7cec2c796524ef7141a789861034367e8730126445a9ce5f97268bd71b3461a6","observation_id":"a1fdbbcd-5da7-4f93-bd9f-ec4bf45b17e8","resolution":{"observed_at":"2026-08-08T18:34:26.742368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.06526","last_updated":"2025-03-01T12:34:10Z","snapshot_observed_at":"2026-08-08T18:24:11.820620Z","submitted_at":"2024-10-09T03:56:50Z","title":"KOR-Bench: Benchmarking Language Models on Knowledge-Orthogonal Reasoning Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.06526","snapshot_observed_at":"2026-08-08T18:34:26.750021Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.750021Z"},"links":{"cited_paper":"/paper/2410.06526","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:efddf35b61e0341c888a3f6393a2c430f992f06111c1c1243fd113105551b8af","observation_id":"4e8ba3d3-1d6f-4555-a55d-665076f171aa","resolution":{"observed_at":"2026-08-08T18:34:26.750021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-08T18:34:26.754527Z","title":"Masry, D","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.754527Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:06f38acc05aa16ce64a2e6d160bc2580332beb564c27d8ed86161a29256a480d","observation_id":"652a2938-4f87-4910-8a2f-cf95a524bc88","resolution":{"observed_at":"2026-08-08T18:34:26.754527Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01653","last_updated":"2021-09-03T17:56:40Z","snapshot_observed_at":"2026-08-04T08:05:07.544242Z","submitted_at":"2021-09-03T17:56:40Z","title":"CREAK: A Dataset for Commonsense Reasoning over Entity Knowledge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01653","snapshot_observed_at":"2026-08-08T18:34:26.761666Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.761666Z"},"links":{"cited_paper":"/paper/2109.01653","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:8ef4350a62f47f3669c2a51e5dcc6fbf2470041c359c40d24fd12d5e4217ce2a","observation_id":"86c95cac-c9d8-4708-8375-4f91d80da6d3","resolution":{"observed_at":"2026-08-08T18:34:26.761666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:34:26.765639Z","title":"GPT-4 technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.765639Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:ebb8bee3eade8a4c022cee39722e2089d732cecff4cbc2c9378f4a850ae09cb5","observation_id":"936b3ffc-bc94-46b8-958c-f6d1a55b483f","resolution":{"observed_at":"2026-08-08T18:34:26.765639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-08T18:34:26.769019Z","title":"URL https://doi.org/10.48550/arXiv.2303.08774","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.769019Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:f93b380a33a6918b0e7dfbada05e3bf5fcc40d883279e4972e53d8fd36ff5627","observation_id":"9e0daa46-0ed4-4942-b1a6-267367916437","resolution":{"observed_at":"2026-08-08T18:34:26.769019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.345201Z","title":"In Domain_Words, Words denotes the number of words encoded in the given question","venue":null,"work_id":"f95e00a5-085d-4983-93a4-f669caba7a17","year":2004},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.809026Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:971be74ec75ad4f1d7585f66ce7d6539cc277c597af37d584ae2f1d2f0137542","observation_id":"68e73fb4-2b23-4b32-9e9d-74a7a73040ba","resolution":{"observed_at":"2026-08-08T18:34:27.349044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.03350","last_updated":"2023-10-17T18:57:17Z","snapshot_observed_at":"2026-07-31T15:52:06.089691Z","submitted_at":"2022-10-07T06:50:23Z","title":"Measuring and Narrowing the Compositionality Gap in Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.03350","snapshot_observed_at":"2026-08-08T18:34:26.775997Z","title":"doi: 10.18653 /v1/2020.emnlp-main.185","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.775997Z"},"links":{"cited_paper":"/paper/2210.03350","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:1426add0d24f1c96eed375fb18111d0bc4cdb0a6d4e53f38ffdca670688cf18b","observation_id":"518baa32-b162-4b38-b82b-87fef3d11aff","resolution":{"observed_at":"2026-08-08T18:34:26.775997Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.05605","last_updated":"2024-02-28T21:00:13Z","snapshot_observed_at":"2026-07-06T16:17:00.299422Z","submitted_at":"2023-09-11T16:39:30Z","title":"Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language Models","version":3},"cited_work":{"arxiv_id":"2309.05605","doi":null,"metadata_source":"pith","pith_arxiv_id":"2309.05605","snapshot_observed_at":"2026-08-08T18:34:26.965607Z","title":"Memory Injections: Correcting Multi-Hop Reasoning Failures during Inference in Transformer-Based Language Models","venue":"cs.CL","work_id":"bf983187-6f08-496d-8181-f50494b99aa3","year":2023},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.779685Z"},"links":{"cited_paper":"/paper/2309.05605","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:34f1a8e0a15d7c0ef0fcf3d1bb5d9165ed1d59ac7688b4b18ae622e626bd0b95","observation_id":"15e6df3c-a392-48ea-ab19-f338dc71fe53","resolution":{"observed_at":"2026-08-08T18:34:26.969627Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2106.00969","last_updated":"2021-06-02T06:31:55Z","snapshot_observed_at":"2026-07-06T11:15:06.264738Z","submitted_at":"2021-06-02T06:31:55Z","title":"COM2SENSE: A Commonsense Reasoning Benchmark with Complementary Sentences","version":1},"cited_work":{"arxiv_id":"2106.00969","doi":null,"metadata_source":"pith","pith_arxiv_id":"2106.00969","snapshot_observed_at":"2026-08-08T18:34:26.950768Z","title":"COM2SENSE: A Commonsense Reasoning Benchmark with Complementary Sentences","venue":"cs.CL","work_id":"0e7da59a-c87a-4d98-8d69-18501555ad1b","year":2021},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.783168Z"},"links":{"cited_paper":"/paper/2106.00969","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:5679168c3f20ef9f5b1467bae6160b505a3d9acb555790afb66c59fca1d06105","observation_id":"d93e3111-19dc-4ca9-b6e5-662e7f598c04","resolution":{"observed_at":"2026-08-08T18:34:26.954943Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.09261","last_updated":"2022-10-17T17:08:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-10-17T17:08:26Z","title":"Challenging BIG-Bench Tasks and Whether Chain-of-Thought Can Solve Them","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.09261","snapshot_observed_at":"2026-08-08T18:34:26.786749Z","title":"Suzgun, N","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.786749Z"},"links":{"cited_paper":"/paper/2210.09261","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:97373b196863167e2427919a2c10c06631b4593c76f1782b88d4a00e6732caac","observation_id":"f2c5ac7a-a6e2-4931-a46e-a312c619e32d","resolution":{"observed_at":"2026-08-08T18:34:26.786749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.15071","last_updated":"2024-10-30T18:47:53Z","snapshot_observed_at":"2026-07-06T18:19:00.169416Z","submitted_at":"2024-05-23T21:42:19Z","title":"Grokked Transformers are Implicit Reasoners: A Mechanistic Journey to the Edge of Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.15071","snapshot_observed_at":"2026-08-08T18:34:26.790561Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.790561Z"},"links":{"cited_paper":"/paper/2405.15071","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:0dee543ec4e9189d0d11cd5641052d6421b321741c0c0d102dfbd9b044c1f293","observation_id":"60fb0b32-6fdd-4301-9796-28c7e711193a","resolution":{"observed_at":"2026-08-08T18:34:26.790561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15574","last_updated":"2024-04-24T00:24:03Z","snapshot_observed_at":"2026-08-06T03:07:12.026697Z","submitted_at":"2024-04-24T00:24:03Z","title":"Retrieval Head Mechanistically Explains Long-Context Factuality","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15574","snapshot_observed_at":"2026-08-08T18:34:26.794369Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.794369Z"},"links":{"cited_paper":"/paper/2404.15574","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:e22cbb2ef797df694c0cc3d669880064b60c4320ee1c3b8267af827aa1285f97","observation_id":"a3e2b4d0-6647-42c4-8a7e-ec9194fab777","resolution":{"observed_at":"2026-08-08T18:34:26.794369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-08T18:34:26.798112Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.798112Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:4afe6ca272dac54856205f8cd340fba4fefb97e79ff06cc9d82b05f9b64f59a9","observation_id":"62f1b971-13f2-4aa7-9d9a-f6353a2c4c5d","resolution":{"observed_at":"2026-08-08T18:34:26.798112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13816","last_updated":"2024-06-18T16:30:01Z","snapshot_observed_at":"2026-08-07T18:11:32.500682Z","submitted_at":"2024-05-22T16:46:19Z","title":"Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.13816","snapshot_observed_at":"2026-08-08T18:34:26.801743Z","title":"Zhang, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.801743Z"},"links":{"cited_paper":"/paper/2405.13816","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:5ae0fccefb82b047d57911c7905451fed0b571c6bb92131634e655646980228b","observation_id":"8baab08c-8576-4f14-86ab-0fc728ceae9d","resolution":{"observed_at":"2026-08-08T18:34:26.801743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.13816","last_updated":"2024-06-18T16:30:01Z","snapshot_observed_at":"2026-08-07T18:11:32.500682Z","submitted_at":"2024-05-22T16:46:19Z","title":"Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners","version":2},"cited_work":{"arxiv_id":"2405.13816","doi":"10.48550/arxiv.2405.13816","metadata_source":"pith","pith_arxiv_id":"2405.13816","snapshot_observed_at":"2026-08-09T00:16:22.132183Z","title":"Getting More from Less: Large Language Models are Good Spontaneous Multilingual Learners","venue":"cs.CL","work_id":"f34cd28d-714f-4d29-baa7-3d4ce298798c","year":2024},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.805435Z"},"links":{"cited_paper":"/paper/2405.13816","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:d6a605516407e2eac3475c705c2ea088868378cfeeeb82b189a791fab69c37cc","observation_id":"10966f3b-5996-410e-af9f-27accce9a829","resolution":{"observed_at":"2026-08-08T18:34:26.855372Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.335104Z","title":"In Domain_Words, Words denotes the number of words encoded in the given question","venue":null,"work_id":"99c9e3ad-491e-4a67-90f2-7aa6f9da6eca","year":2002},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.811860Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:71fb9925d14f0d261adf6fe6da5b98f0f630a101ea544ccf7304f43906482e88","observation_id":"04568401-4326-42b3-a0e7-5d7d9dfb16fa","resolution":{"observed_at":"2026-08-08T18:34:27.338667Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.324849Z","title":"gold standard","venue":null,"work_id":"93a60799-3166-4166-b9a3-f4b6ca94a597","year":2024},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.814690Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:2e2e6d7252b76c92c27e8d3b086be515c11426de8be5868aa27f583c7f6c2d1b","observation_id":"6a4687c2-516c-4ca2-bdd8-a90eccde5856","resolution":{"observed_at":"2026-08-08T18:34:27.328482Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.304230Z","title":"WHICH FOOTBALL TEAM WON THE WORLD CUP IN 2018 AND THROUGH WHICH LENS OF CHILDHOOD EYES DID THE SOLDIERS?","venue":null,"work_id":"c0046739-ad3c-4a9f-9d68-e9f7d09aee28","year":2018},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.820347Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:8d888b7bd171335e5dc1f031c9a9faa28b38ff3751e16eca31ba4d74cf6e6595","observation_id":"9e895137-0b86-46ec-8ca1-f56957b41db5","resolution":{"observed_at":"2026-08-08T18:34:27.308028Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.356945Z","title":null,"venue":null,"work_id":"ff707aab-9471-4735-ae99-92f014f9043e","year":2020},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2002,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.772608Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:3af6d6865d35ec5fe68abfbaa1eb2a640098d4ebd6ea17c3013a9e248f82505f","observation_id":"1c184897-55e0-4151-b955-7fb4c9ef0f5a","resolution":{"observed_at":"2026-08-08T18:34:27.361364Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.02310","last_updated":"2025-02-24T09:25:51Z","snapshot_observed_at":"2026-08-04T04:41:35.684065Z","submitted_at":"2024-11-04T17:36:40Z","title":"MdEval: Massively Multilingual Code Debugging","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.02310","snapshot_observed_at":"2026-08-08T18:34:26.746312Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2004,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.746312Z"},"links":{"cited_paper":"/paper/2411.02310","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:87953304186958bf6692cf6f5c33c386054dc6a892420409868f29c700c0a216","observation_id":"f167447c-541c-45e9-8052-3bb18fb2021d","resolution":{"observed_at":"2026-08-08T18:34:26.746312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.185594Z","title":"Nostalgebraist","venue":null,"work_id":"faec385b-e2ee-46df-89bc-4765e373fcb5","year":2017},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.758125Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:be44e2e2df2da9963bb106964dc0ff0d96b0a1043258e2a6b422e944e8f90e34","observation_id":"1257f69c-e07f-4bb1-aeac-b723add7ebc4","resolution":{"observed_at":"2026-08-08T18:34:27.189377Z","resolver_source":"arxiv_id_nonexistent","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-08T18:34:27.368578Z","title":null,"venue":null,"work_id":"5702a4b1-fe9c-479c-a5ab-23ef48430775","year":2023},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.730433Z"},"links":{"citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:6e8381bf67d9a69d76af7b08384dc56de8886c94294b791f898a751ac2fd5372","observation_id":"aea7e8c3-cfe4-41e4-ab65-61c26e5b097a","resolution":{"observed_at":"2026-08-08T18:34:27.371913Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2011.01060","last_updated":"2020-11-12T07:47:48Z","snapshot_observed_at":"2026-07-06T10:10:56.466018Z","submitted_at":"2020-11-02T15:42:40Z","title":"Constructing A Multi-hop QA Dataset for Comprehensive Evaluation of Reasoning Steps","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.01060","snapshot_observed_at":"2026-08-08T18:34:26.724372Z","title":"Ho, A.-K","venue":null,"work_id":null,"year":2011},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.724372Z"},"links":{"cited_paper":"/paper/2011.01060","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:ca6bdb2ef2c177e94a3889dfa818f93dadee47095e2f19a40ab154484c3a5673","observation_id":"819165ce-9185-4f63-90b9-ad869203cfcd","resolution":{"observed_at":"2026-08-08T18:34:26.724372Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-08T18:34:26.705289Z","title":"Dubey, A","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.705289Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:3b175c4a25cd7a267d0a4308d64d1ce0c6db2edc05a774db546f0749403c37ea","observation_id":"b990aa96-800a-4fad-a30c-3b72dc7b3148","resolution":{"observed_at":"2026-08-08T18:34:26.705289Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.08414","last_updated":"2024-10-10T23:09:08Z","snapshot_observed_at":"2026-08-05T10:02:01.684450Z","submitted_at":"2024-10-10T23:09:08Z","title":"Understanding the Interplay between Parametric and Contextual Knowledge for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.08414","snapshot_observed_at":"2026-08-08T18:34:26.696989Z","title":"Cheng, L","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.696989Z"},"links":{"cited_paper":"/paper/2410.08414","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:7af3e33f6632e0269285b63500238b90100436c3cde4a4897210425d23639565","observation_id":"2f6b8b88-8861-4f05-9c91-f210d82fe01a","resolution":{"observed_at":"2026-08-08T18:34:26.696989Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-08T18:34:26.692438Z","title":"Accessed: 2024-09-21","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T18:34:26.692438Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2502.07813"},"observation_digest":"sha256:2228e41f468a32edf4fde4095fd5680e88d040c5e68200f14e0f765ee378b328","observation_id":"4b70aba3-ed82-4839-b29d-c718607ce05a","resolution":{"observed_at":"2026-08-08T18:34:26.692438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2502.07813","last_updated":"2025-03-12T13:17:27Z","latest_version":2,"primary_category":"cs.CR","snapshot_observed_at":"2026-08-08T18:28:00.443323Z","submitted_at":"2025-02-08T17:19:43Z","title":"CryptoX : Compositional Reasoning Evaluation of Large Language Models"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":26,"verified_exact":4,"verified_fuzzy":4},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2502.07813."}