{"as_of":"2026-08-13T11:33:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:42d35be09086efa45e9d9ad10ba7897829935620b02f5e8d7435f4089e4e29cf","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T06:00:38.833910Z","state":"measured"},{"denominator":48,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":48,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-13T06:32:02.005865+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.17019/citation-record","integrity":"/paper/2412.17019/integrity","json":"/paper/2412.17019/citation-record.json","paper":"/paper/2412.17019"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.619270Z","title":"URL: \" 'urlintro :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.619270Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:bfdec8a0acc242709088e0d871d342c1bb9f1817ee9d4d86dc0e88735a544e23","observation_id":"620b57af-f5b6-4810-aa43-6f8e60cce290","resolution":{"observed_at":"2026-08-11T06:00:38.619270Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.624968Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.624968Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:4d7ebb83fffa4904fb92cd03c3dc91a9dd97f4608ed87623be9c3e535f69641c","observation_id":"69f100e7-0477-4de7-8800-2fd1de30ad1a","resolution":{"observed_at":"2026-08-11T06:00:38.624968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.540322Z","title":null,"venue":null,"work_id":"465432d5-e659-4a3e-9462-916751e4fdb4","year":2018},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.630305Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:2e79552ea7898be6fe6fedbdd096ccfad8684e193bbdb6842217c52307c7ca3a","observation_id":"706ef6a7-62ff-416f-a3b2-ba663aba29e7","resolution":{"observed_at":"2026-08-11T06:00:39.545007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.526444Z","title":null,"venue":null,"work_id":"e48a383e-cafc-482f-add8-d5350744a65b","year":2021},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.635324Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:ed4b5673538b957b29c6289118e8ad713a74c1083aa51aadca08c3746ae24659","observation_id":"6a5bf91c-6455-4d42-8180-174510c64450","resolution":{"observed_at":"2026-08-11T06:00:39.531007Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.640036Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.640036Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:5f9c920f6e1e63b0bce9f16b85e37eae39b96ec08afcb698f9a823af5823839a","observation_id":"2bac1fdc-ff85-4d0a-ae15-a49c47a9d475","resolution":{"observed_at":"2026-08-11T06:00:38.640036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.502733Z","title":null,"venue":null,"work_id":"8fc6947e-0b06-4dea-b51c-a180197f832c","year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.644787Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:623fc786b263e57e0ebe8945c6d653fd42c6ea18552b6715253fd9a38b6e257e","observation_id":"5df77d16-ad49-43b7-8489-d1637188bfd3","resolution":{"observed_at":"2026-08-11T06:00:39.507491Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2301.00234","last_updated":"2024-10-05T11:47:02Z","snapshot_observed_at":"2026-07-06T14:36:25.690733Z","submitted_at":"2022-12-31T15:57:09Z","title":"A Survey on In-context Learning","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2301.00234","snapshot_observed_at":"2026-08-11T06:00:38.649207Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.649207Z"},"links":{"cited_paper":"/paper/2301.00234","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:4f72f2384e432530b7858531261045d59cdfc2982fdb2b0167e464633b7cacce","observation_id":"ec07b667-a7a2-4274-aaae-d1501f94de2b","resolution":{"observed_at":"2026-08-11T06:00:38.649207Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.487306Z","title":null,"venue":null,"work_id":"a3484c87-94c4-4e9a-ae34-357133b79877","year":2021},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.654160Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:2263b07f560aac2a19c3a0e9a635a095f83cf9a95c8964a4498e0b0b946a9f55","observation_id":"e657096d-f071-4693-b8a6-cd68c7627f2b","resolution":{"observed_at":"2026-08-11T06:00:39.492220Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.472074Z","title":null,"venue":null,"work_id":"2259129f-d50e-48e2-8968-67e6008d362c","year":2022},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.659109Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:7e57797f69285be7569368b9aef77584c3df547ab782fa79ff197136dad9bb50","observation_id":"cde2cdb8-d0f7-4262-95bd-efc7b8ab90cf","resolution":{"observed_at":"2026-08-11T06:00:39.476823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.663356Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.663356Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:332acc4db4dc795bfd11fd12e94ed50091b483e42e2e363e1e52154309eac17f","observation_id":"b1699512-76dc-4c96-b206-acc3bb802b79","resolution":{"observed_at":"2026-08-11T06:00:38.663356Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.457451Z","title":null,"venue":null,"work_id":"89716675-59f3-4b56-b23b-6e6eca2a5bb2","year":2020},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.667694Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:5512b69ebec76e0b0cb091717dec108e2fb2f5dcfe8383cb6eeb63ef3b4dbb98","observation_id":"d62eb6af-27ca-4680-9989-548c72e5e1cb","resolution":{"observed_at":"2026-08-11T06:00:39.462566Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.672348Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.672348Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:8f4c83cda6701479db7014bc263d130f611bd3535a0ed933f9e85114ced9280e","observation_id":"bd9352eb-adce-41bf-99fe-49c43e24eb7f","resolution":{"observed_at":"2026-08-11T06:00:38.672348Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.434008Z","title":null,"venue":null,"work_id":"dbf6367b-717a-492b-8807-46699ee0e90e","year":2024},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.676668Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:f6ac84462b536268103f382585e186244f667a00022d1879ca480f6322e66d04","observation_id":"d70bf17f-ef97-4cd6-9465-d07d00584b7f","resolution":{"observed_at":"2026-08-11T06:00:39.438786Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.419612Z","title":null,"venue":null,"work_id":"07195255-7861-4d36-b246-edd25c715cd0","year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.681056Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:1095901d5ec1776713d2c7e4d97f05697f7e34e695976da3378e70a76b739a16","observation_id":"1bc18136-2b5a-4175-8ee6-5e89869569a6","resolution":{"observed_at":"2026-08-11T06:00:39.424252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.685491Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.685491Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:a17ae3c9061289b680b59c2865ee7004fb8eb5f7bec04189c2d7aec6fbc78fe2","observation_id":"0f3a803d-6693-44a6-acff-4d3a4bcd4d2a","resolution":{"observed_at":"2026-08-11T06:00:38.685491Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.690684Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.690684Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:538f6ce3ec513bbcba346b7b17d81925fe32804941e1f748b4da6774bb3111a2","observation_id":"2a505e70-2d60-4edd-a747-39212e57353f","resolution":{"observed_at":"2026-08-11T06:00:38.690684Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.695131Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.695131Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:39424a396caab0f4ea799b4d7a075fb09d3edfac19e0de7417ba80854b74dc1c","observation_id":"5c9b3b55-af39-42e0-8332-111d9fbe967e","resolution":{"observed_at":"2026-08-11T06:00:38.695131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.395056Z","title":null,"venue":null,"work_id":"7393f4cc-df6b-40d0-9ef9-4794c978901a","year":1988},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.699371Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:0d9d8f8c1c0f9511212027d307bd2ce61d16d5fb63fdd80f78368041a093c168","observation_id":"ef196a78-ab84-4a6a-9114-6b3a11bd9ee7","resolution":{"observed_at":"2026-08-11T06:00:39.399933Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.704605Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.704605Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:74ed109446cc9b83d8389e1bba32185b323a7e7758095ecb0673048f2d7e4cd2","observation_id":"7f9ab124-1f46-435c-8ee2-7b700317832a","resolution":{"observed_at":"2026-08-11T06:00:38.704605Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.371447Z","title":null,"venue":null,"work_id":"9640483c-0105-4955-b2be-d4b435bde6ba","year":2016},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.709122Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:dddb5635a8cfc603b35547a33349e55b59a04f38b9f3a92d88fb79f30d28c147","observation_id":"3ce826c7-2d05-4e76-a979-72ae659567a7","resolution":{"observed_at":"2026-08-11T06:00:39.376106Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.03576","last_updated":"2023-07-07T13:09:18Z","snapshot_observed_at":"2026-08-13T11:00:16.318987Z","submitted_at":"2023-07-07T13:09:18Z","title":"One Step of Gradient Descent is Provably the Optimal In-Context Learner with One Layer of Linear Self-Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.03576","snapshot_observed_at":"2026-08-11T06:00:38.713955Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.713955Z"},"links":{"cited_paper":"/paper/2307.03576","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:cbdff410c933b37429a80a0b616b492772cbb3b5be74520d8e444685e86425f2","observation_id":"6217acc9-50e9-4d68-a09d-c66b0571c45d","resolution":{"observed_at":"2026-08-11T06:00:38.713955Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.356620Z","title":null,"venue":null,"work_id":"87584e1d-c62f-4233-abb2-022173df17f3","year":2022},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.718836Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:109e58249ed5ce5949f8f422b7ee136b1c61e43d035ffcb0e2a42a5b5fa620bb","observation_id":"38352ba5-a066-4f92-968a-aa098501394e","resolution":{"observed_at":"2026-08-11T06:00:39.361428Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.340771Z","title":null,"venue":null,"work_id":"889508c6-592f-4c6d-9ede-1a32bea63951","year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.722961Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:c4662b88034559110632429cdc9fe481dfd13f0323f4f967b822d4d4a137d52b","observation_id":"20e010a7-8ef6-4893-aa81-ef908345985b","resolution":{"observed_at":"2026-08-11T06:00:39.346516Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.727336Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.727336Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:6d9374754b92b04c5efccba04d52d6d2c688bce110c184216fea8bc066cf386b","observation_id":"8ee49ffb-ea23-49a2-b39e-474658e5fad4","resolution":{"observed_at":"2026-08-11T06:00:38.727336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.325498Z","title":null,"venue":null,"work_id":"5f1bdfdf-c70a-40f4-8678-e0183ab1a19a","year":2017},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.731732Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:37cb9d76c6c0d189332032b2f858b41c558c269bd02a534bc32f0f8eed0e72f7","observation_id":"20436d33-a522-497c-ab4d-a76e17cd6d34","resolution":{"observed_at":"2026-08-11T06:00:39.330583Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.735956Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.735956Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:e12655d7f4614a89b84dcaa3139a842b3d656bb3dd56ce48a9736bfc10f1e5a8","observation_id":"73a5f332-a0d0-42a8-a400-7146b79760e1","resolution":{"observed_at":"2026-08-11T06:00:38.735956Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.740134Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.740134Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:cd41b9981bf0911655891125f89e2a56f3eafc1c5d635585ff2781a6e7ffa446","observation_id":"9dd1fcd9-8c64-4087-af76-6a50821613f9","resolution":{"observed_at":"2026-08-11T06:00:38.740134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.291844Z","title":null,"venue":null,"work_id":"5e9f9ccf-e978-429c-96b4-4b39d9160702","year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.744794Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:7dcebe23e1fc30d594c30614501457ca987671c1e41b8a1084b751ed6cdaf0ea","observation_id":"431ffcf6-bbb8-4bbe-b5a8-78212ad7b3c6","resolution":{"observed_at":"2026-08-11T06:00:39.296442Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.277336Z","title":null,"venue":null,"work_id":"549f1db1-e3db-435c-8c06-34d8e80c13f7","year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.749185Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:b6046c064358f87fa0ab47087612b8d583aad80674dd26b373e08f4810a44c31","observation_id":"e457b792-71e3-4dc9-ab5c-4c2d390b1608","resolution":{"observed_at":"2026-08-11T06:00:39.282013Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.262557Z","title":null,"venue":null,"work_id":"7b08cece-66dc-43fb-b15e-326b12660af0","year":2014},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.753314Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:e0f0d60d3a551a6838616353274ec380c97349aebf4c96fdb5668adf8638f153","observation_id":"791e9a40-2bd2-4b62-a36d-cddef6ec498e","resolution":{"observed_at":"2026-08-11T06:00:39.267247Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.757583Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.757583Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:918271d551ab0be6bd2314775a839be8d8465ac5030214c9cfdcddc8d856bcb2","observation_id":"6e953ab1-6409-4d05-bcc6-8b46d3c06f15","resolution":{"observed_at":"2026-08-11T06:00:38.757583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.16898","last_updated":"2024-02-22T18:38:14Z","snapshot_observed_at":"2026-08-13T10:23:06.468131Z","submitted_at":"2023-08-31T17:57:50Z","title":"Transformers as Support Vector Machines","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.16898","snapshot_observed_at":"2026-08-11T06:00:38.761946Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.761946Z"},"links":{"cited_paper":"/paper/2308.16898","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:a6dac5e530b9d8946f571562cd7e20017beb73f11ee9a9225b4262011fcd087d","observation_id":"b951175a-0437-4df9-9c9d-a1006038d219","resolution":{"observed_at":"2026-08-11T06:00:38.761946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.16380","last_updated":"2023-10-30T17:32:08Z","snapshot_observed_at":"2026-08-13T11:33:16.232315Z","submitted_at":"2023-05-25T15:59:13Z","title":"Scan and Snap: Understanding Training Dynamics and Token Composition in 1-layer Transformer","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.16380","snapshot_observed_at":"2026-08-11T06:00:38.766687Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.766687Z"},"links":{"cited_paper":"/paper/2305.16380","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:6def33ddfac99953a5ad366a5cab1d9fcaa361e00154755042b01737bf94595a","observation_id":"219b7a93-c3e2-4cd3-af51-c5ad16f840bf","resolution":{"observed_at":"2026-08-11T06:00:38.766687Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.15213","last_updated":"2024-02-25T18:32:18Z","snapshot_observed_at":"2026-08-13T05:42:53.020730Z","submitted_at":"2023-10-23T17:55:24Z","title":"Function Vectors in Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.15213","snapshot_observed_at":"2026-08-11T06:00:38.771236Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.771236Z"},"links":{"cited_paper":"/paper/2310.15213","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:2987dd177101e6c93bde3f74c9b98dfdd52a7678f465709c6846a513e037c827","observation_id":"1ced0d0c-f46c-4abd-8ae9-f5cf4a022ccd","resolution":{"observed_at":"2026-08-11T06:00:38.771236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T06:00:38.775927Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.775927Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:9c3402b8107489d35bc6c784b28c98ba7dacac351edff269ba4b33adb25a7b08","observation_id":"77d51de4-20dd-4b9a-90bb-15d267e8f743","resolution":{"observed_at":"2026-08-11T06:00:38.775927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.780568Z","title":null,"venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.780568Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:7180ae72b85c18fab0421ccffdc92564d3a96d910491b40d08a971d3fe1dd0a6","observation_id":"ca54b518-3220-4538-9c33-f4ff44602fe4","resolution":{"observed_at":"2026-08-11T06:00:38.780568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.229228Z","title":null,"venue":null,"work_id":"510e1f97-e192-42ea-9482-1705d1628692","year":2020},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.785023Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:fdac193b9631213ae42bcbf2af794de4b1cb81958231196735d0d243d3523f39","observation_id":"58b4fcd1-b840-4e43-af45-84140e90eecc","resolution":{"observed_at":"2026-08-11T06:00:39.233941Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.04827","last_updated":"2023-09-09T15:51:36Z","snapshot_observed_at":"2026-08-13T10:17:23.440940Z","submitted_at":"2023-09-09T15:51:36Z","title":"Neurons in Large Language Models: Dead, N-gram, Positional","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.04827","snapshot_observed_at":"2026-08-11T06:00:38.789496Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.789496Z"},"links":{"cited_paper":"/paper/2309.04827","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:ef640dbb3a230d377e424cc049b32a5823ef79c11ca99ad0499582665fa1c2f6","observation_id":"94f9f378-430c-4e99-9658-2ffbe3eae93a","resolution":{"observed_at":"2026-08-11T06:00:38.789496Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.793805Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.793805Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:f7d326b28a920c5723410d3dde0539fb5c33316987f496f081be3897fbe7b253","observation_id":"2cdca2ea-bb22-4248-9fb5-bd7ef5924ebf","resolution":{"observed_at":"2026-08-11T06:00:38.793805Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:39.203409Z","title":null,"venue":null,"work_id":"97a11e78-716a-4847-80bc-91307d30d7e9","year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.797942Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:f2a48a5397d88d81d8bee231bc5f4ac236508adb829ecce54a186c71eee6a199","observation_id":"a81bf314-ec7d-45e2-ba48-6122f9ca61da","resolution":{"observed_at":"2026-08-11T06:00:39.209156Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-13T06:32:02.005865+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.03771","last_updated":"2020-07-14T03:42:34Z","snapshot_observed_at":"2026-07-06T08:27:58.343233Z","submitted_at":"2019-10-09T03:23:22Z","title":"HuggingFace's Transformers: State-of-the-art Natural Language Processing","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1910.03771","snapshot_observed_at":"2026-08-11T06:00:38.801931Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.801931Z"},"links":{"cited_paper":"/paper/1910.03771","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:3b268c2d846a0251bde31387202dc591d8aa49b93768744676458184d707d77f","observation_id":"8d090988-c255-4db0-94c6-f7a478228d2d","resolution":{"observed_at":"2026-08-11T06:00:38.801931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.806577Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.806577Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:beca08a837825c4a4fb1fb6295fa9decf66a315e49299a6d49d5da3580fb77a7","observation_id":"40e42c3c-a4f5-4e5a-b169-babf83398177","resolution":{"observed_at":"2026-08-11T06:00:38.806577Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.810700Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.810700Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:14d7f9b662b65a2fd26b7da508dadb3c3649bcf9ca2ba9e40c44d4bb18d5c0b6","observation_id":"ca04a931-f967-496b-81eb-1a7c39cc6507","resolution":{"observed_at":"2026-08-11T06:00:38.810700Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-11T06:00:38.815310Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.815310Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:5b7df4c9b936e52200745da42f555a9be0a7db3d13a64fa800c46796119a9d95","observation_id":"edc2be9a-07e6-40e8-8323-bedf69ba8f90","resolution":{"observed_at":"2026-08-11T06:00:38.815310Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-08-11T06:00:38.819686Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.819686Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:22b19ef74bf5530705528099b05e0b2e0b14a4783c8c0d2a879b7f374a56a9ef","observation_id":"007f243f-6f75-4793-908e-fb603c3caab8","resolution":{"observed_at":"2026-08-11T06:00:38.819686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.824200Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.824200Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:32c3f9101edef05714a38598dcb4c9ce5495e20a3023dd76c8b33bf3da708768","observation_id":"74857f5e-631d-4ebf-a964-3d0285a53349","resolution":{"observed_at":"2026-08-11T06:00:38.824200Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.828910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.828910Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:4af9a777929178137e9885a6f637f9ec1b7e8aec35e41f77c0901f195f261949","observation_id":"8c92a21c-8368-4e8b-81f5-2cb082a091b9","resolution":{"observed_at":"2026-08-11T06:00:38.828910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T06:00:38.833910Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-11T06:00:38.833910Z"},"links":{"citing_paper":"/paper/2412.17019"},"observation_digest":"sha256:867a3a7084b5677fb002be47a11c530fc2804a3ba2d6154f11b22b29f9d83fcf","observation_id":"f341b33a-4a20-4ce9-8c1a-b46f7fcd57cb","resolution":{"observed_at":"2026-08-11T06:00:38.833910Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.17019","last_updated":"2024-12-22T13:48:04Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T22:26:53.265163Z","submitted_at":"2024-12-22T13:48:04Z","title":"Reversed Attention: On The Gradient Descent Of Attention Layers In GPT"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":48,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-13T06:32:02.005865+00:00","source":"crossref"},{"observed_at":"2026-08-13T06:31:53.387327+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 0 inbound Pith citation observations for arXiv:2412.17019."}