{"as_of":"2026-08-18T17:05:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:00cbcdd00a007d70d91017c32663a4b0963e99ebd2766b7570f827d675098293","coverage":[{"denominator":55,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":55,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T21:23:19.683563Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-18T06:34:40.430872+00:00","state":"measured"},{"denominator":4,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":4,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-09T19:58:59.001963Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-04T18:30:01.548468Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.04703","snapshot_observed_at":"2026-08-09T19:58:59.001963Z","title":"Y ., Padmakumar, V ., Kazemi, S","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2502.00197","last_updated":"2025-06-19T02:03:39Z","snapshot_observed_at":"2026-08-17T08:01:42.718624Z","submitted_at":"2025-01-31T22:27:09Z","title":"Learning Model Successors","version":2},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-08-09T19:58:59.001963Z"},"links":{"cited_paper":"/paper/2412.04703","citing_paper":"/paper/2502.00197"},"observation_digest":"sha256:80159d0ea16dfb325ee5909567fb562c4254e66fee69e0c28b1f6fde7a16daf6","observation_id":"d4f6cb72-df3d-437e-b23b-b124e62a1508","resolution":{"observed_at":"2026-08-09T19:58:59.001963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"cited_work":{"arxiv_id":"2412.04703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04703","snapshot_observed_at":"2026-07-04T18:30:01.548468Z","title":"Transformers struggle to learn to search","venue":null,"work_id":"9b74f407-edfa-41fd-8786-41685bb993a4","year":2024},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-16T03:19:50.202624Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":156,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2412.04703","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:79989b9118c40363dfa68ca18cb3147f8456b4cacbcc6ca3d7d69cf28fc99f39","observation_id":"7ec384c1-1725-47de-93dc-1d0d5b419856","resolution":{"observed_at":"2026-05-21T20:40:36.248925Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"cited_work":{"arxiv_id":"2412.04703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04703","snapshot_observed_at":"2026-07-04T18:30:01.548468Z","title":"Transformers struggle to learn to search","venue":null,"work_id":"9b74f407-edfa-41fd-8786-41685bb993a4","year":2024},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-08-14T23:27:30.054684Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-25T22:47:09.330723Z"},"links":{"cited_paper":"/paper/2412.04703","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:bc3cfef4d81e37b2391a2732e7a429f37643a30c347b665378009855d52996f0","observation_id":"d7c55bfe-74ec-4d1e-81ca-04faee1eca52","resolution":{"observed_at":"2026-07-04T18:30:01.550549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"cited_work":{"arxiv_id":"2412.04703","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.04703","snapshot_observed_at":"2026-07-04T18:30:01.548468Z","title":"Transformers struggle to learn to search","venue":null,"work_id":"9b74f407-edfa-41fd-8786-41685bb993a4","year":2024},"citing_paper":{"arxiv_id":"2606.25178","last_updated":"2026-06-27T02:34:55Z","snapshot_observed_at":"2026-08-14T23:27:30.054684Z","submitted_at":"2026-06-23T21:10:29Z","title":"Transferability for General Reasoning: An Automated Curriculum for Multi-Domain RLVR","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-30T09:55:19.804589Z"},"links":{"cited_paper":"/paper/2412.04703","citing_paper":"/paper/2606.25178"},"observation_digest":"sha256:31b58e2c62b851c5bfea7d4a2acea6b9c1354b516f7693b5b0ed6a0e51cc54ad","observation_id":"a3fe979f-3292-456c-9016-47fbe5b3efea","resolution":{"observed_at":"2026-06-30T12:54:40.469233Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-18T06:34:40.430872+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2412.04703/citation-record","integrity":"/paper/2412.04703/integrity","json":"/paper/2412.04703/citation-record.json","paper":"/paper/2412.04703"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.034837Z","title":"The pitfalls of next-token prediction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.034837Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:20ded653640c59b4659bbf43da6bb58e6063f1f596702276027396d1f8c1ade1","observation_id":"d1679e7f-5b94-4676-8389-92e3ff74c4e8","resolution":{"observed_at":"2026-08-11T21:23:18.034837Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.061252Z","title":"Chayes, and Oliver Riordan","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.061252Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:24e5193a5391ef42812746145bb19c8a8c8d709aa8cf77b4596167d8235d092b","observation_id":"1d64f964-a203-4e23-8816-930b0df033f8","resolution":{"observed_at":"2026-08-11T21:23:18.061252Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.098761Z","title":"Navigating the labyrinth: Evaluating and enhancing llms' ability to reason about search problems","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.098761Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:2920919f3c5d9be2f5d546b6f139c99870480e73526cc6a482279c8dd11559f2","observation_id":"df3ea3e7-4af4-4b30-8cd9-19312a372cd0","resolution":{"observed_at":"2026-08-11T21:23:18.098761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.107751Z","title":"A mechanistic analysis of a transformer trained on a symbolic multi-step reasoning task","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.107751Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:aa235c82a0846724bfa35fd253ef4bbe207130756dfbb28a736c2439656f3772","observation_id":"dd610724-019f-408f-8f4d-84bb9b674d60","resolution":{"observed_at":"2026-08-11T21:23:18.107751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.144757Z","title":"Broken neural scaling laws","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.144757Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:35e766608bff7ff7d2d75a4e11ec494f9bd2315f333497af9467a31366ed29bf","observation_id":"11274699-17dc-4186-88b2-f3586e847e94","resolution":{"observed_at":"2026-08-11T21:23:18.144757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.176766Z","title":"Selection-inference: Exploiting large language models for interpretable logical reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.176766Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:d9a08b8509eb51c723328707d5a42b68f814c156d5871d86ca6a79dee013c8fb","observation_id":"cdb70207-cb20-4f03-9c14-71c114094329","resolution":{"observed_at":"2026-08-11T21:23:18.176766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.192561Z","title":"MANGO : A benchmark for evaluating mapping and navigation abilities of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.192561Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:9418b8d4946410766d592ea6f14729c060fc1f6709d4608b6e9737339f353108","observation_id":"10c64ddb-cd88-4340-8f10-8fd686585049","resolution":{"observed_at":"2026-08-11T21:23:18.192561Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.15796","last_updated":"2025-01-15T02:48:59Z","snapshot_observed_at":"2026-08-16T14:07:07.590212Z","submitted_at":"2024-03-23T11:03:31Z","title":"Understanding Emergent Abilities of Language Models from the Loss Perspective","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.15796","snapshot_observed_at":"2026-08-11T21:23:18.236330Z","title":"Understanding emergent abilities of language models from the loss perspective","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.236330Z"},"links":{"cited_paper":"/paper/2403.15796","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:7285d9168fb6e4363e970355623f9abd7795e433010cc1726fee193f4b2d6cbd","observation_id":"1f0ea792-e8cb-4c82-9b3c-10668f5f4238","resolution":{"observed_at":"2026-08-11T21:23:18.236330Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.264180Z","title":"On random graphs i","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.264180Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:6ca7573a59e6b24c153ba3d409b66f1df7b1a8c76e97b24302c9399b89b3f80e","observation_id":"73d55e71-a122-43ae-bdc1-a53d139f7400","resolution":{"observed_at":"2026-08-11T21:23:18.264180Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.290090Z","title":"Nphardeval: Dynamic benchmark on reasoning ability of large language models via complexity classes","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.290090Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:2d3db3891b37150cff32f4904fa09256fbaa718fb939b64140be336c74712261","observation_id":"9b985b0a-d8b0-4dff-b00d-c400a6f802b5","resolution":{"observed_at":"2026-08-11T21:23:18.290090Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.01266","last_updated":"2024-08-18T23:48:44Z","snapshot_observed_at":"2026-08-16T14:04:34.571745Z","submitted_at":"2024-04-01T17:43:27Z","title":"IsoBench: Benchmarking Multimodal Foundation Models on Isomorphic Representations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.01266","snapshot_observed_at":"2026-08-11T21:23:18.311622Z","title":"Isobench: Benchmarking multimodal foundation models on isomorphic representations","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.311622Z"},"links":{"cited_paper":"/paper/2404.01266","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:0c41aec5876294096bb6cd91fb5f41d5b13622fd6b43d8fc62d0d4137c64c64f","observation_id":"71cd4a9e-414f-4992-b289-3f1ac3ee3f6a","resolution":{"observed_at":"2026-08-11T21:23:18.311622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.03683","last_updated":"2024-04-01T06:50:52Z","snapshot_observed_at":"2026-08-17T18:41:15.883469Z","submitted_at":"2024-04-01T06:50:52Z","title":"Stream of Search (SoS): Learning to Search in Language","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.03683","snapshot_observed_at":"2026-08-11T21:23:18.345312Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.345312Z"},"links":{"cited_paper":"/paper/2404.03683","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:393e87fa7b5d70e92a5297b58139f606cda6fb2dbdc93127853b91c834a76aa3","observation_id":"104e3407-c852-48ec-8abb-ae75d4c1cd3f","resolution":{"observed_at":"2026-08-11T21:23:18.345312Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.375908Z","title":"Causal abstractions of neural networks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.375908Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:0d2a7d2b2f696911981d94e51db0670c43b9a8065c34461d6d0b05eed31f5dbe","observation_id":"4f143306-0a22-45ae-9dae-81d64194d569","resolution":{"observed_at":"2026-08-11T21:23:18.375908Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.405868Z","title":"Reasoning with language model is planning with world model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.405868Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:44ee9be710e61b98a9b60e5be59f60865728855bc5b160de4fe7f7ff30ffce8d","observation_id":"26b39704-4a58-4d26-9a4d-de74fb655623","resolution":{"observed_at":"2026-08-11T21:23:18.405868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.15255","last_updated":"2024-04-23T17:42:29Z","snapshot_observed_at":"2026-08-12T21:46:28.191953Z","submitted_at":"2024-04-23T17:42:29Z","title":"How to use and interpret activation patching","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.15255","snapshot_observed_at":"2026-08-11T21:23:18.443944Z","title":"How to use and interpret activation patching","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.443944Z"},"links":{"cited_paper":"/paper/2404.15255","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:81ead0427c016260ca67cc836302ec6fdeeb2f5d02db4a2ca2bd48839854d98c","observation_id":"f5f8c87c-d2d6-433d-8be8-6b5842bfcfcb","resolution":{"observed_at":"2026-08-11T21:23:18.443944Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.14701","last_updated":"2020-11-06T04:16:36Z","snapshot_observed_at":"2026-07-06T10:09:17.078776Z","submitted_at":"2020-10-28T02:17:24Z","title":"Scaling Laws for Autoregressive Generative Modeling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.14701","snapshot_observed_at":"2026-08-11T21:23:18.485404Z","title":"Brown, Prafulla Dhariwal, Scott Gray, Chris Hallacy, Benjamin Mann, Alec Radford, Aditya Ramesh, Nick Ryder, Daniel M","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.485404Z"},"links":{"cited_paper":"/paper/2010.14701","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:88c8e9710473da3cfcaf72f63d354500eeb06acf57eacdcf48c5ca4906cc0e20","observation_id":"51da9c90-7a30-46a2-b557-aaaa1d566fad","resolution":{"observed_at":"2026-08-11T21:23:18.485404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-08-09T19:52:33.533277Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-11T21:23:18.505370Z","title":"Rae, Oriol Vinyals, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.505370Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:78cbf702e8593da2ce91e563717d0df20b3d3ec9098f1036cf923b95bdce4d8b","observation_id":"9864039c-8677-4f0e-9005-0799b019d8f9","resolution":{"observed_at":"2026-08-11T21:23:18.505370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.534764Z","title":"Towards a mechanistic interpretation of multi-step reasoning capabilities of language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.534764Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:e31780f52d8537a6aed60ae2e2d7e1b2dbbc6f907fcbf50e68ad7438cc199db0","observation_id":"657f5358-2040-4dc4-a379-10e34192d1e0","resolution":{"observed_at":"2026-08-11T21:23:18.534764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.574748Z","title":"Ivanitskiy, Alex F","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.574748Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:5f67a363c2da1d7a25baa1f08e2dedd40ca38ef221187d2a0950c48e164b8c1b","observation_id":"5aa628f1-20cb-447e-880d-b8409832fafc","resolution":{"observed_at":"2026-08-11T21:23:18.574748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.00877","last_updated":"2024-06-02T21:57:32Z","snapshot_observed_at":"2026-08-16T13:46:57.069653Z","submitted_at":"2024-06-02T21:57:32Z","title":"Evidence of Learned Look-Ahead in a Chess-Playing Neural Network","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.00877","snapshot_observed_at":"2026-08-11T21:23:18.624747Z","title":"Evidence of learned look-ahead in a chess-playing neural network","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.624747Z"},"links":{"cited_paper":"/paper/2406.00877","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:23fedd25e849acb363c0c07e7256c84a040d1633c68a915b5eb5f93af0c65593","observation_id":"ecd14e13-ffdd-4850-a129-91145b991296","resolution":{"observed_at":"2026-08-11T21:23:18.624747Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01817","last_updated":"2024-06-12T01:13:11Z","snapshot_observed_at":"2026-08-16T14:22:07.383531Z","submitted_at":"2024-02-02T14:43:18Z","title":"LLMs Can't Plan, But Can Help Planning in LLM-Modulo Frameworks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.01817","snapshot_observed_at":"2026-08-11T21:23:18.674748Z","title":"Llms can't plan, but can help planning in llm-modulo frameworks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.674748Z"},"links":{"cited_paper":"/paper/2402.01817","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:e06eb3ceee6b4a83b2e2abb94b13f2176d21a54a48cc6b3d8af61099a71fdced","observation_id":"493c13b4-9c45-4bf9-b3c3-8955a2392c41","resolution":{"observed_at":"2026-08-11T21:23:18.674748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-11T21:23:18.744739Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.744739Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:2cd0455b1f141f7adc5d2abaca5f47438e97d122acd0d75196d21c595f81d2a3","observation_id":"55fd31fc-6907-405a-8990-85bea024bd9f","resolution":{"observed_at":"2026-08-11T21:23:18.744739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.784758Z","title":"LAMBADA : Backward chaining for automated reasoning in natural language","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.784758Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:3c2f5240fc4f195e44ed1d01159086342e656789f5a39a4bf5afe61d49cb7708","observation_id":"c2025373-42ef-46bc-822e-77ccc89a5eda","resolution":{"observed_at":"2026-08-11T21:23:18.784758Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.08590","last_updated":"2025-06-21T10:50:24Z","snapshot_observed_at":"2026-08-16T13:26:05.119509Z","submitted_at":"2024-08-16T07:47:39Z","title":"Reasoning Circuits in Language Models: A Mechanistic Interpretation of Syllogistic Inference","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.08590","snapshot_observed_at":"2026-08-11T21:23:18.824751Z","title":"A mechanistic interpretation of syllogistic reasoning in auto-regressive language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.824751Z"},"links":{"cited_paper":"/paper/2408.08590","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:06572382596e83c94553bcc912500fd2f1dd8f825c1949e2812a78450026c880","observation_id":"f3e3bbd2-6a0c-432e-bf77-f4b9ee2b1347","resolution":{"observed_at":"2026-08-11T21:23:18.824751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.854842Z","title":"COGS: A compositional generalization challenge based on semantic interpretation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.854842Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:102a0c8bf7ccb2441dc3b3cb2478b251f451ef5c8129b340314ca106e1363aa4","observation_id":"e562d411-b2a5-4453-8c72-c03e739c8379","resolution":{"observed_at":"2026-08-11T21:23:18.854842Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.917084Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.917084Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:15860d0060da79385713de38dc24064db75b34b0c053c839f9bfaeddff948fab","observation_id":"b5afb4e6-5ce5-41df-bcd5-f3b7493ce5fd","resolution":{"observed_at":"2026-08-11T21:23:18.917084Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.961375Z","title":"Sophia: A scalable stochastic second-order optimizer for language model pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.961375Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:cbc5fcc37e362f37028e6f04ffa0d8fa9c240060d2a56ceb835baf85231d75f9","observation_id":"2ce00579-0d70-4bca-836a-c0bed74f2036","resolution":{"observed_at":"2026-08-11T21:23:18.961375Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:18.994755Z","title":"The expressive power of transformers with chain of thought","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:18.994755Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:04348bd36225fa2e7097e1a1e5991a9648e02ec442d4b6eb9e3a60865e4c0b8d","observation_id":"52108f53-b0c5-4b1f-adba-be64a0cf6e71","resolution":{"observed_at":"2026-08-11T21:23:18.994755Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00114","last_updated":"2021-11-30T21:32:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-30T21:32:46Z","title":"Show Your Work: Scratchpads for Intermediate Computation with Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.00114","snapshot_observed_at":"2026-08-11T21:23:19.054746Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.054746Z"},"links":{"cited_paper":"/paper/2112.00114","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:a50ce210aa9d4a7a7462c3a23b44ccd86763fe4e0cf579c72a39b3b0ec74e481","observation_id":"5c00560c-6586-4218-8b35-dbc7b4633c79","resolution":{"observed_at":"2026-08-11T21:23:19.054746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.104066Z","title":"Language models are unsupervised multitask learners","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.104066Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:0594b2a07084f11542692d8eaf5547e31791143f0c1c19628ebc50525a59fedb","observation_id":"777ea6ec-d165-47f2-8604-fa065da21f42","resolution":{"observed_at":"2026-08-11T21:23:19.104066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.04494","last_updated":"2024-10-21T09:37:12Z","snapshot_observed_at":"2026-08-16T14:20:47.495242Z","submitted_at":"2024-02-07T00:36:24Z","title":"Amortized Planning with Large-Scale Transformers: A Case Study on Chess","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.04494","snapshot_observed_at":"2026-08-11T21:23:19.110027Z","title":"Lewis, Joel Veness, and Tim Genewein","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.110027Z"},"links":{"cited_paper":"/paper/2402.04494","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:72293ad6ce549625922af0fe16ee5429d4b44876c4ebbcb6b5bdfe4e7a21bb27","observation_id":"a28cfea9-b106-4e3c-a79a-13f68bf97052","resolution":{"observed_at":"2026-08-11T21:23:19.110027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18512","last_updated":"2024-05-28T18:31:14Z","snapshot_observed_at":"2026-08-16T13:48:28.623355Z","submitted_at":"2024-05-28T18:31:14Z","title":"Understanding Transformer Reasoning Capabilities via Graph Algorithms","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18512","snapshot_observed_at":"2026-08-11T21:23:19.134743Z","title":"Understanding transformer reasoning capabilities via graph algorithms","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.134743Z"},"links":{"cited_paper":"/paper/2405.18512","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:883e85c346075b34f1732c270ca7d361888025de5ab64d819ed4fb0f38e4c785","observation_id":"5a115100-4814-4650-b092-38713c5a8973","resolution":{"observed_at":"2026-08-11T21:23:19.134743Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.159899Z","title":"Transformers, parallel computation, and logarithmic depth","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.159899Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:5c5ed146d40529a22237335bc5d766552a654388ffb272bfff270fb114450d0e","observation_id":"02ec3486-2925-4105-a811-a5146056454f","resolution":{"observed_at":"2026-08-11T21:23:19.159899Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.01240","last_updated":"2023-03-02T03:54:28Z","snapshot_observed_at":"2026-08-16T16:27:11.895195Z","submitted_at":"2022-10-03T21:34:32Z","title":"Language Models Are Greedy Reasoners: A Systematic Formal Analysis of Chain-of-Thought","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.01240","snapshot_observed_at":"2026-08-11T21:23:19.169820Z","title":"Language models are greedy reasoners: A systematic formal analysis of chain-of-thought","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.169820Z"},"links":{"cited_paper":"/paper/2210.01240","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:4fdc36dd96a2bf1556e42f05720254f3be674595ee9375223272e8061e3660a4","observation_id":"087589f8-3887-4c0f-9f11-47a265fb73b2","resolution":{"observed_at":"2026-08-11T21:23:19.169820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.178280Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.178280Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:1aace848e9d1c8fe590f8b825120ef74837e8fb3c5d19b4ac7709b70dd8169d3","observation_id":"8c99d95a-d46b-4483-8d07-1686e85dd71e","resolution":{"observed_at":"2026-08-11T21:23:19.178280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.10502","last_updated":"2024-09-16T17:42:15Z","snapshot_observed_at":"2026-08-16T13:18:05.144759Z","submitted_at":"2024-09-16T17:42:15Z","title":"Causal Language Modeling Can Elicit Search and Reasoning Capabilities on Logic Puzzles","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.10502","snapshot_observed_at":"2026-08-11T21:23:19.190653Z","title":"Causal language modeling can elicit search and reasoning capabilities on logic puzzles","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.190653Z"},"links":{"cited_paper":"/paper/2409.10502","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:654d1a8302ec5d449799a0cf581f3d08f05873e37a83c20d8b7566ee6d768eea","observation_id":"934fcccc-6664-403d-b2a8-50bdbf46c7c3","resolution":{"observed_at":"2026-08-11T21:23:19.190653Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09830","last_updated":"2025-05-02T10:41:18Z","snapshot_observed_at":"2026-08-16T14:42:42.450145Z","submitted_at":"2023-11-16T11:55:27Z","title":"Automating the Generation of Prompts for LLM-based Action Choice in PDDL Planning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09830","snapshot_observed_at":"2026-08-11T21:23:19.196272Z","title":"Autoplanbench: Automatically generating benchmarks for llm planners from pddl","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.196272Z"},"links":{"cited_paper":"/paper/2311.09830","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:86e08d6d00247868eb16690fb6823c2060db43672b2e20e6fd812e73a011d382","observation_id":"ef64644b-6a8d-4e49-b72d-f87027294819","resolution":{"observed_at":"2026-08-11T21:23:19.196272Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.208020Z","title":"A mechanistic interpretation of arithmetic reasoning in language models using causal mediation analysis","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.208020Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:8dc137f0cb69247061f2b60f32931126df63e78d24b7580d4e672b39ca0e5bda","observation_id":"e47e32e1-24b8-4d4e-ad8c-4ff3b2fab67d","resolution":{"observed_at":"2026-08-11T21:23:19.208020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.235159Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.235159Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:c7f18f36c3cb485f3f65d10600fbdfe93d668106e0e44571af439a3c6fcf7327","observation_id":"1e8f52fa-ae47-46de-a58b-88a1bd386e61","resolution":{"observed_at":"2026-08-11T21:23:19.235159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.246097Z","title":"Large language models still can't plan (a benchmark for LLM s on planning and reasoning about change)","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.246097Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:9b305052912700102d74b205004e77e8c727788dd2217b17cafb565db4732c8e","observation_id":"3de13916-13a9-4696-9126-bf425ab08576","resolution":{"observed_at":"2026-08-11T21:23:19.246097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.256053Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.256053Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:52e37e5346f63e194e051868df09f414abe39d368badee29b78448b7a307c4e8","observation_id":"5398d32d-0858-41de-aaa2-ead31066c5ce","resolution":{"observed_at":"2026-08-11T21:23:19.256053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2004.12265","last_updated":"2020-11-22T07:58:08Z","snapshot_observed_at":"2026-08-10T09:04:33.884910Z","submitted_at":"2020-04-26T01:53:03Z","title":"Causal Mediation Analysis for Interpreting Neural NLP: The Case of Gender Bias","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2004.12265","snapshot_observed_at":"2026-08-11T21:23:19.294795Z","title":null,"venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.294795Z"},"links":{"cited_paper":"/paper/2004.12265","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:d7650df36b8f3deb4af2088b1c197af451a6004bf6b168371c55fa655b1d45bf","observation_id":"3be3e374-19ec-4da8-b54c-517a536f6a6b","resolution":{"observed_at":"2026-08-11T21:23:19.294795Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.327818Z","title":"Can language models solve graph problems in natural language? In Thirty-seventh Conference on Neural Information Processing Systems, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.327818Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:5ffbcdce21e01d255366730a23044fec59753ddd09f7ec4a39161067bc85b4fa","observation_id":"90c1f23c-d696-4e64-8ff5-908393abd3bc","resolution":{"observed_at":"2026-08-11T21:23:19.327818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.337469Z","title":"Chi, Tatsunori Hashimoto, Oriol Vinyals, Percy Liang, Jeff Dean, and William Fedus","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.337469Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:1ae77e931f6127de7bc1565cf4de7237a729ad52a930600f876912b9c25c3644","observation_id":"cbb33be4-010e-4c34-98c5-ee753dcca058","resolution":{"observed_at":"2026-08-11T21:23:19.337469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.355709Z","title":"Chi, Quoc V Le, and Denny Zhou","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.355709Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:f4c29c932f62871830651755c89954986f3c23dd6a7e9ff94a8d47a59d242f77","observation_id":"9f99029e-9c2e-476c-8ab5-0400bdcf1f33","resolution":{"observed_at":"2026-08-11T21:23:19.355709Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.368564Z","title":"Do large language models latently perform multi-hop reasoning? In Annual Meeting of the Association for Computational Linguistics, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.368564Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:fcc55af020adfc63c10261aa81e61ec2e4fb4909bb7f8197bf0be7aa7165bcfe","observation_id":"4e07f63b-1334-449b-94a8-e7d062c3810d","resolution":{"observed_at":"2026-08-11T21:23:19.368564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.386912Z","title":"Tree of thoughts: Deliberate problem solving with large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.386912Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:1886f39957323ae11ad62845e25639b071656227aabba091b66ad3840007324b","observation_id":"218b0302-467a-4fbe-bc87-14cdd170672a","resolution":{"observed_at":"2026-08-11T21:23:19.386912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.424031Z","title":"Towards best practices of activation patching in language models: Metrics and methods","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.424031Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:c5d1ced63fb8b4fc611806313788e5fa17b43fe78061ae99038404162b529a49","observation_id":"305afb5f-b017-472a-bd74-cf02cb095d33","resolution":{"observed_at":"2026-08-11T21:23:19.424031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.473617Z","title":"On the paradox of learning to reason from data","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.473617Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:febc3a6adb9800e1ab9c3c3b9e15a2cb6e5c26865f9781d2ca9b3a14725a04a8","observation_id":"a58bb081-ad87-4fb9-ae56-6ab526a07d2b","resolution":{"observed_at":"2026-08-11T21:23:19.473617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.15992","last_updated":"2024-10-11T05:42:01Z","snapshot_observed_at":"2026-08-17T02:43:29.842349Z","submitted_at":"2024-06-23T02:59:15Z","title":"Can LLM Graph Reasoning Generalize beyond Pattern Memorization?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.15992","snapshot_observed_at":"2026-08-11T21:23:19.512369Z","title":"Can llm graph reasoning generalize beyond pattern memorization? ArXiv, abs/2406.15992, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.512369Z"},"links":{"cited_paper":"/paper/2406.15992","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:f74933640f2eb14a693e528c7d9118a42004b56fd892c9c9666444ddefd90d11","observation_id":"0230a035-c28a-4762-9624-869fb46ef87f","resolution":{"observed_at":"2026-08-11T21:23:19.512369Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09371","last_updated":"2024-02-14T18:18:29Z","snapshot_observed_at":"2026-08-16T14:18:33.026651Z","submitted_at":"2024-02-14T18:18:29Z","title":"Transformers Can Achieve Length Generalization But Not Robustly","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09371","snapshot_observed_at":"2026-08-11T21:23:19.546715Z","title":"Transformers can achieve length generalization but not robustly","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.546715Z"},"links":{"cited_paper":"/paper/2402.09371","citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:05527a6ba998712532aae7e5d0b3e6b3439f3577dcc4cdb0b3c4d799e473c30f","observation_id":"e60dc3b5-80b9-4b17-aa45-d811891e0c9f","resolution":{"observed_at":"2026-08-11T21:23:19.546715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.574757Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.574757Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:38043e7d54f94afcfd108e1b1a5e3b1c35e34ff3bb0f83da169cd22da825c3f0","observation_id":"32f652f6-3e09-4452-9d40-62d422537df7","resolution":{"observed_at":"2026-08-11T21:23:19.574757Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.634762Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.634762Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:bc9e90e4b898e0925a3bb58f0a022355434314023341856b40b5372ca898b247","observation_id":"2b860569-a968-4e93-87cb-8fc35f612c36","resolution":{"observed_at":"2026-08-11T21:23:19.634762Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.676295Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.676295Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:3e92faf1e70c72a096fc533e5c2a4a55ce877d7a4cd4338a839d95c17c309625","observation_id":"e769fb05-7b93-4f7c-8bc3-339ee432b330","resolution":{"observed_at":"2026-08-11T21:23:19.676295Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T21:23:19.683563Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search","version":2},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-11T21:23:19.683563Z"},"links":{"citing_paper":"/paper/2412.04703"},"observation_digest":"sha256:613ba056d002d6d874caa733f6696a55bf4b650a0724237a7c230a7483dffa6c","observation_id":"fc4baed3-7ea8-419d-ab76-cb9d33ba0d55","resolution":{"observed_at":"2026-08-11T21:23:19.683563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.04703","last_updated":"2025-03-16T11:57:25Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T13:00:32.352556Z","submitted_at":"2024-12-06T01:29:24Z","title":"Transformers Struggle to Learn to Search"},"reference_resolution":{"displayed":55,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":55,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":55},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-18T06:34:40.430872+00:00","source":"crossref"},{"observed_at":"2026-08-18T06:34:34.496301+00:00","source":"retraction_watch"}],"thesis":"As of 18 August 2026, this Paper Citation Record lists 55 of 55 outbound references and 4 inbound Pith citation observations for arXiv:2412.04703."}