{"as_of":"2026-08-18T04:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:439f1b9f4175d68938c7688584f953925a6184e04b2b82e6d9c87a0b7c8f2ebf","coverage":[{"denominator":29,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":29,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-15T23:20:08.568346Z","state":"measured"},{"denominator":29,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":29,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2505.04914/citation-record","integrity":"/paper/2505.04914/integrity","json":"/paper/2505.04914/citation-record.json","paper":"/paper/2505.04914"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.468639Z","title":"Language models are few-shot learners,","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.468639Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:0ff42ccbe15a60cce72e391d9705096be258acb2f72821104477f9e0598547fd","observation_id":"333aca7d-44e7-4a81-b141-ed8db403be5b","resolution":{"observed_at":"2026-08-15T23:20:08.468639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.472690Z","title":"Large language models are zero-shot reasoners,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.472690Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:c4b9f6f14e09898d09d67436db88b8684d67bb139adff1952b2f5a7a71b92d39","observation_id":"5e8f6177-913b-41d5-af9d-4105ac1346d8","resolution":{"observed_at":"2026-08-15T23:20:08.472690Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.937306Z","title":"Emergent abilities of large language models,","venue":null,"work_id":"92936e30-3212-4978-a230-98fa47b8c9e6","year":2022},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.476360Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:e72d412706f2baa1adbefee1bb430807a36b8197a623d18fe48bad858241a448","observation_id":"4f4c8c94-beb7-4d88-9ab6-936d28ee658d","resolution":{"observed_at":"2026-08-15T23:20:08.943339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-15T23:20:08.479874Z","title":"Sparks of artificial general intelligence: Early experiments with gpt-4,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.479874Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:2ee19d01d2031b15285eac4847ce279c6abafe7afd4ca771500d26b2b2216811","observation_id":"4f69adf3-6afa-410c-b08b-e55dce563efc","resolution":{"observed_at":"2026-08-15T23:20:08.479874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.10770","last_updated":"2022-11-02T19:53:44Z","snapshot_observed_at":"2026-08-16T16:58:39.165802Z","submitted_at":"2022-05-22T07:43:50Z","title":"Memorization Without Overfitting: Analyzing the Training Dynamics of Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.10770","snapshot_observed_at":"2026-08-15T23:20:08.484192Z","title":"Memorization without overfitting: Analyzing the training dynamics of large language models,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.484192Z"},"links":{"cited_paper":"/paper/2205.10770","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:c7a297b31ac0db6d8a0efd367b0c8cd81d2e06cac0328f5be0ba6356962da7dd","observation_id":"69417eef-736a-40ba-9acc-e855007ffeff","resolution":{"observed_at":"2026-08-15T23:20:08.484192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.18362","last_updated":"2023-10-24T14:25:53Z","snapshot_observed_at":"2026-08-16T14:49:19.852945Z","submitted_at":"2023-10-24T14:25:53Z","title":"SoK: Memorization in General-Purpose Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.18362","snapshot_observed_at":"2026-08-15T23:20:08.488011Z","title":"Sok: Memorization in general-purpose large language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.488011Z"},"links":{"cited_paper":"/paper/2310.18362","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:eb680c6ae14bbaafa8b5101a547b64b8abbd583af3f1cb0a8b45600784d7437c","observation_id":"da2fc541-3f33-4fae-b90c-6d8a45b1345a","resolution":{"observed_at":"2026-08-15T23:20:08.488011Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.926473Z","title":null,"venue":null,"work_id":"cec7c451-1b7a-43af-be02-076ea8f05d4d","year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.492026Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:5d1cb2d93cc02fa8f68fd4c142c2fea2589714f74ac0609137cfa50a5d0477d3","observation_id":"a8abbe21-7763-4344-bf70-28c043c00879","resolution":{"observed_at":"2026-08-15T23:20:08.929798Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09605","last_updated":"2025-07-03T20:10:24Z","snapshot_observed_at":"2026-08-16T13:52:24.120292Z","submitted_at":"2024-05-15T17:19:42Z","title":"Elements of World Knowledge (EWoK): A Cognition-Inspired Framework for Evaluating Basic World Knowledge in Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09605","snapshot_observed_at":"2026-08-15T23:20:08.495579Z","title":"Elements of world knowledge (ewok): A cognition-inspired framework for evaluating basic world knowledge in language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.495579Z"},"links":{"cited_paper":"/paper/2405.09605","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:5b1329160bfb9f93cb3323217fd747660d449885981fea96288593573fc07117","observation_id":"57a493b4-dac7-4c51-8c40-317b29909cb1","resolution":{"observed_at":"2026-08-15T23:20:08.495579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.914946Z","title":"McCorduck, Machines Who Think: A Personal Inquiry into the History and Prospects of Artificial Intelligence","venue":null,"work_id":"aeac5661-123a-466d-9b37-20915c21d79d","year":2004},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.499331Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:0826772c189ac0bb5e638d3823848a00a44cd7e4c7d7fe3ed460d581794e9956","observation_id":"518dd686-baa3-47c2-aa78-58e8a2ebe417","resolution":{"observed_at":"2026-08-15T23:20:08.919204Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1911.01547","last_updated":"2019-11-25T13:02:04Z","snapshot_observed_at":"2026-08-17T05:38:14.090895Z","submitted_at":"2019-11-05T00:31:38Z","title":"On the Measure of Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1911.01547","snapshot_observed_at":"2026-08-15T23:20:08.503732Z","title":"On the measure of intelligence,","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.503732Z"},"links":{"cited_paper":"/paper/1911.01547","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:e258a71022821af5fbcd1e1e460bd29eea0adada733abdce139b3f95f9c187b9","observation_id":"043baa1d-48d3-4f8f-b2c0-ebe92d14104f","resolution":{"observed_at":"2026-08-15T23:20:08.503732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19736","last_updated":"2023-11-25T17:35:12Z","snapshot_observed_at":"2026-08-17T07:14:41.768935Z","submitted_at":"2023-10-30T17:00:52Z","title":"Evaluating Large Language Models: A Comprehensive Survey","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19736","snapshot_observed_at":"2026-08-15T23:20:08.506938Z","title":"Evaluating large language models: A comprehensive survey,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.506938Z"},"links":{"cited_paper":"/paper/2310.19736","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:714837894ea9159b13b8924ba45400cd8c59fcf88612112915614d0ab7fd6f8e","observation_id":"c030bab5-6e7e-41c6-a4c0-6476e242bd4f","resolution":{"observed_at":"2026-08-15T23:20:08.506938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.510370Z","title":"A survey on evaluation of large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.510370Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:1d0ab51ae9657aa6b3f0ee0d4bd41c0a18d19c9d6815009d5cb76db7b390ec31","observation_id":"701eaa0a-b922-4945-b917-1ddf75e2539c","resolution":{"observed_at":"2026-08-15T23:20:08.510370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.513721Z","title":"Challenges and applications of large language models,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.513721Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:c6bfdded447856692d731c9cc4c8af87bd4f2176b1ed124f40ad1d02dc4bb3c3","observation_id":"b02b5006-0ba1-4891-82ec-71dd956c850f","resolution":{"observed_at":"2026-08-15T23:20:08.513721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.898081Z","title":"Llmrg: Improving recommendations through large language model reasoning graphs,","venue":null,"work_id":"18018376-0d33-4239-b0f5-2c2528a00433","year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.520461Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:79ffb203bad1597029c2f642d403ed1698e142b51e1e60cd8aa3585bc3f98e12","observation_id":"ed7d9718-e454-42a8-b0e3-2ec90d0e0881","resolution":{"observed_at":"2026-08-15T23:20:08.902101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.887298Z","title":"Language models as agent models,","venue":null,"work_id":"0238b922-c87b-4061-85c7-b733d50426dc","year":2022},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.523819Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:94b9e711952077fa242dc2c87207adea965c2e4c0e14ba3ee03be347268012fa","observation_id":"14a1b7a0-5b6f-4688-9b4e-95105873ac88","resolution":{"observed_at":"2026-08-15T23:20:08.890811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.527247Z","title":"ReAct: Synergizing reasoning and acting in language models,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.527247Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:c5e3074b702046bf0ad280e2e063acc9c3e8e0ac745f171e102b753c4cf31747","observation_id":"9b408a06-8115-4f97-93e6-81635fc54f3f","resolution":{"observed_at":"2026-08-15T23:20:08.527247Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.530551Z","title":"Chain-of-thought prompting elicits reasoning in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.530551Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:1e2e42a08f02b582fdc6d34faa1c600e639be07b9e822863f7ed1a505a94d476","observation_id":"39ae713b-5ec7-4602-a424-c51cb3affc8f","resolution":{"observed_at":"2026-08-15T23:20:08.530551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04890","last_updated":"2026-06-23T03:21:15Z","snapshot_observed_at":"2026-08-17T13:22:41.359174Z","submitted_at":"2024-03-07T20:48:40Z","title":"Few shot chain-of-thought driven reasoning to prompt LLMs for open ended medical question answering","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04890","snapshot_observed_at":"2026-08-15T23:20:08.533705Z","title":"Few shot chain-of- thought driven reasoning to prompt llms for open ended medical question answering,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.533705Z"},"links":{"cited_paper":"/paper/2403.04890","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:699a2993b216e64e8a9b1fb4f3899a4cc0539654558a8697c8783ff2ea9f4f88","observation_id":"8965a074-44a9-4a7d-af14-3aedf77bf502","resolution":{"observed_at":"2026-08-15T23:20:08.533705Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.865323Z","title":"Automatic chain of thought prompting in large language models,","venue":null,"work_id":"b580c459-e699-49b9-8d8e-f4d450b1577a","year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.537247Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:de3cb82bc684ad8f3e86563073bd2cfe2baa6869fade2d9347187ba8607ede62","observation_id":"c15e7fd7-0594-41a5-86a1-ea74a54a257d","resolution":{"observed_at":"2026-08-15T23:20:08.868946Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18272","last_updated":"2024-02-28T12:04:05Z","snapshot_observed_at":"2026-08-16T14:14:33.771779Z","submitted_at":"2024-02-28T12:04:05Z","title":"Rethinking the Bounds of LLM Reasoning: Are Multi-Agent Discussions the Key?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18272","snapshot_observed_at":"2026-08-15T23:20:08.540467Z","title":"Rethinking the bounds of llm reasoning: Are multi-agent discussions the key?","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.540467Z"},"links":{"cited_paper":"/paper/2402.18272","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:dcd3bf3758c48bb8a4f41de67461ecc045d64a7549395dc77da47b4d89d997ca","observation_id":"7ee16372-ad1e-4c3a-99da-532159d07318","resolution":{"observed_at":"2026-08-15T23:20:08.540467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.851989Z","title":"Can neural networks understand monotonicity reasoning?","venue":null,"work_id":"2c22ba00-5963-4e91-b7e5-17cad3216421","year":2019},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.543976Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:339e173bc13c86113b4ee8ca1f71b13f5c11950e3125b6c20ef3ccf95be6b7eb","observation_id":"587fec94-3293-4db4-aacf-97718806b476","resolution":{"observed_at":"2026-08-15T23:20:08.857001Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-15T23:20:08.547216Z","title":"Idea: Enhancing the rule learning ability of large language model agent through induction, deduction, and abduction,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.547216Z"},"links":{"citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:4d254f96bc270bf6c9cac16f6f1cbc222e526645349984afd4d49571365d5183","observation_id":"5e84b47b-ea99-44c7-b5e1-bd7773c0a06a","resolution":{"observed_at":"2026-08-15T23:20:08.547216Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.09841","last_updated":"2024-09-15T07:49:32Z","snapshot_observed_at":"2026-08-16T15:23:20.909976Z","submitted_at":"2023-06-16T13:39:35Z","title":"Are Large Language Models Really Good Logical Reasoners? A Comprehensive Evaluation and Beyond","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.09841","snapshot_observed_at":"2026-08-15T23:20:08.550424Z","title":"Are large language models really good logical reasoners? a comprehensive evaluation and beyond,","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.550424Z"},"links":{"cited_paper":"/paper/2306.09841","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:3ddb2f262bc2d5792b4e6f4e4fe383ef797c5e6e9eb8792b3c11c499de6cdc0d","observation_id":"53d80a29-79cc-4682-ad6f-6a4a680e9708","resolution":{"observed_at":"2026-08-15T23:20:08.550424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11050","last_updated":"2024-10-04T04:40:03Z","snapshot_observed_at":"2026-08-18T02:21:46.521643Z","submitted_at":"2024-06-16T19:22:53Z","title":"A Peek into Token Bias: Large Language Models Are Not Yet Genuine Reasoners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11050","snapshot_observed_at":"2026-08-15T23:20:08.553997Z","title":"A peek into token bias: Large language models are not yet genuine reasoners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.553997Z"},"links":{"cited_paper":"/paper/2406.11050","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:aab3cbf5792f1ac0c2892813d83d4f5c7aeb40534c5b64feaee5c753913ff6fb","observation_id":"47da1ea2-99d4-407b-872c-ec3411d487bb","resolution":{"observed_at":"2026-08-15T23:20:08.553997Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.05229","last_updated":"2025-08-27T16:24:39Z","snapshot_observed_at":"2026-08-16T08:54:56.543625Z","submitted_at":"2024-10-07T17:36:37Z","title":"GSM-Symbolic: Understanding the Limitations of Mathematical Reasoning in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.05229","snapshot_observed_at":"2026-08-15T23:20:08.557571Z","title":"Gsm-symbolic: Understanding the limitations of mathematical reasoning in large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.557571Z"},"links":{"cited_paper":"/paper/2410.05229","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:24ea517c354490292db1b7b2420dbf5141dfa2ae08bf7d8012b1d9c6ca3e0902","observation_id":"6e691e3d-5e6e-48bd-b7a0-bd4c94adcb08","resolution":{"observed_at":"2026-08-15T23:20:08.557571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.08939","last_updated":"2024-05-28T04:32:09Z","snapshot_observed_at":"2026-08-17T02:16:30.649052Z","submitted_at":"2024-02-14T04:50:18Z","title":"Premise Order Matters in Reasoning with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.08939","snapshot_observed_at":"2026-08-15T23:20:08.561070Z","title":"Premise order matters in reasoning with large language models,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.561070Z"},"links":{"cited_paper":"/paper/2402.08939","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:21532a64ec495536206ceebbade06a083c3a8cb5c4ee1b8f5865ff4eeeadfea4","observation_id":"f6194edb-0887-4c0a-af76-0c35cb09657b","resolution":{"observed_at":"2026-08-15T23:20:08.561070Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.19555","last_updated":"2024-01-02T22:30:00Z","snapshot_observed_at":"2026-08-16T15:28:04.517276Z","submitted_at":"2023-05-31T04:50:29Z","title":"Large Language Models Are Not Strong Abstract Reasoners","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.19555","snapshot_observed_at":"2026-08-15T23:20:08.564736Z","title":"Large language models are not strong abstract reasoners,","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.564736Z"},"links":{"cited_paper":"/paper/2305.19555","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:c559cd462bee1e245e434aa31d3816161de0590868e8483cfb313442b2c95ccf","observation_id":"40ada801-bf78-409d-9207-dec4c021e8fc","resolution":{"observed_at":"2026-08-15T23:20:08.564736Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2011.15091","last_updated":"2022-08-01T13:58:56Z","snapshot_observed_at":"2026-08-16T19:02:15.110548Z","submitted_at":"2020-11-30T18:29:25Z","title":"Inductive Biases for Deep Learning of Higher-Level Cognition","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2011.15091","snapshot_observed_at":"2026-08-15T23:20:08.568346Z","title":"Inductive biases for deep learning of higher-level cognition,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.568346Z"},"links":{"cited_paper":"/paper/2011.15091","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:36b8fe2cec787d9f73877ba806e7bf8bbac496c0e4d85edb0b679c1f7a2df17a","observation_id":"71c00e42-9e8d-455e-b729-955d5c97650f","resolution":{"observed_at":"2026-08-15T23:20:08.568346Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.10169","last_updated":"2023-07-19T17:55:13Z","snapshot_observed_at":"2026-08-16T15:14:55.081059Z","submitted_at":"2023-07-19T17:55:13Z","title":"Challenges and Applications of Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.10169","snapshot_observed_at":"2026-08-15T23:20:08.517021Z","title":"Available: https://arxiv.org/abs/2307.10169","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-15T23:20:08.517021Z"},"links":{"cited_paper":"/paper/2307.10169","citing_paper":"/paper/2505.04914"},"observation_digest":"sha256:52d7a4c59b73e27e65edb3f328fd6a1b8548ee6bf1db0a97417c4bf8ef8569fa","observation_id":"bfe22202-1c31-43a6-ae55-7d468a48431d","resolution":{"observed_at":"2026-08-15T23:20:08.517021Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2505.04914","last_updated":"2025-05-08T03:09:57Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-17T13:23:33.492668Z","submitted_at":"2025-05-08T03:09:57Z","title":"Enigme: Generative Text Puzzles for Evaluating Reasoning in Language Models"},"reference_resolution":{"displayed":29,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":23,"verified_exact":0,"verified_fuzzy":6},"total_outbound_references":29},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 29 of 29 outbound references and 0 inbound Pith citation observations for arXiv:2505.04914."}