{"as_of":"2026-08-08T07:21:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7b3b8d691d499ef3bb2480a30f062558f7a9cc9ab301de6d1f1860e720b98cf7","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":17,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":17,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":17,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":17,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-08T00:18:21.263783Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-01T22:06:16.211261Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T13:52:57.267988Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.21024","last_updated":"2025-05-27T10:59:27Z","snapshot_observed_at":"2026-08-08T07:07:38.788827Z","submitted_at":"2025-05-27T10:59:27Z","title":"Pause Tokens Strictly Increase the Expressivity of Constant-Depth Transformers","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T13:52:57.267988Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2505.21024"},"observation_digest":"sha256:f16b116a8f370469bc913e9fd8abb5a573e994dc35edf7f24be60f6b6fbaa342","observation_id":"b0de0330-ed76-4636-9e78-5e132706a0e8","resolution":{"observed_at":"2026-08-07T13:52:57.267988Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T12:46:33.978754Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.23683","last_updated":"2025-05-29T17:22:00Z","snapshot_observed_at":"2026-08-07T21:59:35.039840Z","submitted_at":"2025-05-29T17:22:00Z","title":"Learning Compositional Functions with Transformers from Easy-to-Hard Data","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:46:33.978754Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2505.23683"},"observation_digest":"sha256:d143305f0b0f44f392ba1e2eeec0465b06219e918463f886c5328141dcd5b6fe","observation_id":"23b29014-a63e-4589-8fc7-e3563d33c822","resolution":{"observed_at":"2026-08-07T12:46:33.978754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T10:33:35.409540Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.05200","last_updated":"2025-08-28T16:07:16Z","snapshot_observed_at":"2026-08-08T06:17:18.850826Z","submitted_at":"2025-06-05T16:12:51Z","title":"Transformers Meet In-Context Learning: A Universal Approximation Theory","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-07T10:33:35.409540Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2506.05200"},"observation_digest":"sha256:854a8d3f2d7683de898df4fc68632281b6a3f7b6fa8ec1db56245698d697b193","observation_id":"0892a673-8ad9-4bb9-8ba8-6a3aa63cfb42","resolution":{"observed_at":"2026-08-07T10:33:35.409540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-07T01:18:51.437766Z","title":"Theoretical Limitations of Multi-Layer Transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.11891","last_updated":"2025-06-13T15:38:41Z","snapshot_observed_at":"2026-08-07T00:59:08.161672Z","submitted_at":"2025-06-13T15:38:41Z","title":"Understanding Input Selectivity in Mamba: Impact on Approximation Power, Memorization, and Associative Recall Capacity","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-07T01:18:51.437766Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2506.11891"},"observation_digest":"sha256:8bb480a4147c2dbeb13478b42f35bc9302d1f98f12bfbcc9dedd9fc8b8784044","observation_id":"c7ad6197-2c7d-4432-9d5b-2249cf7b5a9e","resolution":{"observed_at":"2026-08-07T01:18:51.437766Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2507.12549","last_updated":"2026-04-28T23:40:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-16T18:01:26Z","title":"The Serial Scaling Hypothesis","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-19T04:08:11.344622Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2507.12549"},"observation_digest":"sha256:90731461863f752a99adcee5f2df3f02ef904f7112b3ecbeb2341228b72133a5","observation_id":"38a38488-424e-417c-9efa-9dbe9551f1bc","resolution":{"observed_at":"2026-05-19T04:12:02.486141Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-06T11:44:04.879218Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.22448","last_updated":"2025-07-30T07:55:33Z","snapshot_observed_at":"2026-08-06T11:43:58.532083Z","submitted_at":"2025-07-30T07:55:33Z","title":"Falcon-H1: A Family of Hybrid-Head Language Models Redefining Efficiency and Performance","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T11:44:04.879218Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2507.22448"},"observation_digest":"sha256:c4738da3d38d919c4da76fa6f6f0d5556dde543b601fcfc9d9e11df73dc66e72","observation_id":"fea037c4-e0f2-44f6-83db-7d76371b6564","resolution":{"observed_at":"2026-08-06T11:44:04.879218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2510.26745","last_updated":"2026-05-18T17:56:38Z","snapshot_observed_at":"2026-08-02T20:19:54.425869Z","submitted_at":"2025-10-30T17:40:22Z","title":"Deep sequence models tend to memorize geometrically; it is unclear why","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-21T20:38:18.005002Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2510.26745"},"observation_digest":"sha256:79fc32af43a9d7f36b4b4590f16dd8f2f669d9233819a64c7c6f4cb336db9d49","observation_id":"87de76e6-4d0e-4296-a207-0af19beb2fa0","resolution":{"observed_at":"2026-05-21T20:40:36.194169Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-03T20:57:09.914249Z","title":"Theoretical limitations of multi-layer transformer, 2024 a","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2511.17852","last_updated":"2026-08-06T09:30:47Z","snapshot_observed_at":"2026-08-08T07:14:00.552560Z","submitted_at":"2025-11-22T00:38:43Z","title":"Transformers with RL or SFT Provably Learn Sparse Boolean Functions, But Differently","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-03T20:57:09.914249Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2511.17852"},"observation_digest":"sha256:a61309b37cff21cc3fa9e7170c2e8b8c812c3794de6377dca87ac0fcc3e11949","observation_id":"06813133-1349-45ba-96d5-f3f7f8f2f588","resolution":{"observed_at":"2026-08-03T20:57:09.914249Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-13T13:07:00.928770Z","title":"Theoretical lim- itations of multi-layer transformer.arXiv preprint arXiv:2412.02975,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2604.03557","last_updated":"2026-04-04T02:51:46Z","snapshot_observed_at":"2026-08-07T20:31:39.834554Z","submitted_at":"2026-04-04T02:51:46Z","title":"When Do Hallucinations Arise? A Graph Perspective on the Evolution of Path Reuse and Path Compression","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-13T13:07:00.928770Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.03557"},"observation_digest":"sha256:b29b68f84fe6215386a16eb436c70179329b8f171556f6aae778fb6757441af7","observation_id":"ef74e4a7-f24d-426e-a99e-21cdeb40f1fb","resolution":{"observed_at":"2026-07-13T13:07:00.928770Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-08T11:49:49.787123Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:1348939d6c07cab6311b324dff1e551918f3b99fac88c34249c6a4012f4e33c5","observation_id":"58cf521f-8294-41cc-9335-9906260b1043","resolution":{"observed_at":"2026-05-11T19:31:08.240882Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-12T18:26:05.728364Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2604.22951","last_updated":"2026-07-08T19:29:03Z","snapshot_observed_at":"2026-07-12T23:17:30.297545Z","submitted_at":"2026-04-24T18:49:08Z","title":"The Power of Power Law: Asymmetry Enables Compositional Reasoning","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-07-12T18:26:05.728364Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2604.22951"},"observation_digest":"sha256:55e84475b3e0cb107c61ddb6e491b0b271fed0488b865184cb5e3cc960747cd7","observation_id":"346494fb-6aff-40b1-af21-3c6719f9c40d","resolution":{"observed_at":"2026-07-12T18:26:05.728364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2605.09867","last_updated":"2026-05-11T01:51:05Z","snapshot_observed_at":"2026-08-05T16:41:52.125457Z","submitted_at":"2026-05-11T01:51:05Z","title":"Continuous Latent Contexts Enable Efficient Online Learning in Transformers","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-12T05:06:54.598357Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2605.09867"},"observation_digest":"sha256:dead402227ec5074fbc6e3c9e0a0dd28d60c80aa4d3fa882aac675c5489fc74f","observation_id":"0f6a387a-5972-444b-ad9e-d0e0bd7ea9f1","resolution":{"observed_at":"2026-05-12T05:41:23.574147Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2606.00183","last_updated":"2026-05-29T14:58:03Z","snapshot_observed_at":"2026-07-06T23:40:56.510371Z","submitted_at":"2026-05-29T14:58:03Z","title":"Agentic Transformers Provably Learn to Search via Reinforcement Learning","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-06-28T23:26:28.158991Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2606.00183"},"observation_digest":"sha256:309c8e75319c933a7f6d535107504e9c8672880d90c9cc44f858d270990e3616","observation_id":"cb428005-a4ad-4090-8f1a-d89ede65f0a7","resolution":{"observed_at":"2026-06-28T23:42:49.947749Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":"2412.02975","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-07-01T22:06:16.211261Z","title":"Theoretical limitations of multi-layer transformer","venue":null,"work_id":"a29e0ae6-a113-4366-a10e-816b16425963","year":2024},"citing_paper":{"arxiv_id":"2606.01532","last_updated":"2026-06-02T03:44:54Z","snapshot_observed_at":"2026-08-05T19:46:58.020708Z","submitted_at":"2026-06-01T01:28:42Z","title":"Rethinking the Role of Positional Encoding: Sliding-Window Transformers without PE Remain Turing Complete","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-06-28T15:48:48.046003Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2606.01532"},"observation_digest":"sha256:7103b2516c7dc1e843fd9d03a78a4aa3b16e0c9c6d100d8800e3419649db44bb","observation_id":"4b62c3fd-4b9e-4246-80fe-07705c18a1f7","resolution":{"observed_at":"2026-07-01T22:06:16.212640Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-01T21:31:00.903239Z","title":"arXiv preprint arXiv:2412.02975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16072","last_updated":"2026-07-17T15:56:52Z","snapshot_observed_at":"2026-08-05T22:03:26.987913Z","submitted_at":"2026-07-17T15:56:52Z","title":"Frontier Language Models Struggle to Copy: Text Can Be Better Viewed in 2D","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T21:31:00.903239Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2607.16072"},"observation_digest":"sha256:05c72b2c7fadf6c6dc75ea3b1448b72749442af66aed42475760af5f1fbb7823","observation_id":"8bfa3f70-6a48-42be-9ed7-5e34a0907aa8","resolution":{"observed_at":"2026-08-01T21:31:00.903239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-01T20:54:05.553053Z","title":"arXiv preprint arXiv:2412.02975 , year=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16528","last_updated":"2026-07-17T22:09:01Z","snapshot_observed_at":"2026-08-07T07:19:10.753414Z","submitted_at":"2026-07-17T22:09:01Z","title":"Hierarchical Domain Generalization","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-01T20:54:05.553053Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2607.16528"},"observation_digest":"sha256:893238db0b896f2d94f4f762a2d30067fe709abdec29c3abe014a00efd6e8475","observation_id":"d52774c1-9cf4-4ffe-bffc-6140e67f8c26","resolution":{"observed_at":"2026-08-01T20:54:05.553053Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.02975","snapshot_observed_at":"2026-08-08T00:18:21.263783Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.04243","last_updated":"2026-08-04T21:52:04Z","snapshot_observed_at":"2026-08-08T07:10:47.222262Z","submitted_at":"2026-08-04T21:52:04Z","title":"Attention-based representations for multi-task computation","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-08T00:18:21.263783Z"},"links":{"cited_paper":"/paper/2412.02975","citing_paper":"/paper/2608.04243"},"observation_digest":"sha256:bc0e369ef78e6f074a0677499f2f4e69f551f4e359c584ca05e3428fd52fb9f3","observation_id":"2b3d7df0-27b4-4bd4-bce4-d824ce19a4e0","resolution":{"observed_at":"2026-08-08T00:18:21.263783Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2412.02975/citation-record","integrity":"/paper/2412.02975/integrity","json":"/paper/2412.02975/citation-record.json","paper":"/paper/2412.02975"},"outbound":[],"paper":{"arxiv_id":"2412.02975","last_updated":"2024-12-04T02:37:31Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-07-06T20:01:19.215540Z","submitted_at":"2024-12-04T02:37:31Z","title":"Theoretical limitations of multi-layer Transformer"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 17 inbound Pith citation observations for arXiv:2412.02975."}