{"as_of":"2026-08-22T04:23:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:d1411d73cc378c19e3536d632c175a9002c1de01827ace1012f8bd34a0df923e","coverage":[{"denominator":0,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":8,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":8,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-21T06:32:19.484+00:00","state":"measured"},{"denominator":8,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":8,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-14T04:15:48.886209Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-06-30T13:04:40.447109Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-08-11T00:55:03.976160Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.19255","last_updated":"2025-01-14T05:48:07Z","snapshot_observed_at":"2026-08-14T11:12:42.419587Z","submitted_at":"2024-12-26T15:45:45Z","title":"Multi-matrix Factorization Attention","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T00:55:03.976160Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2412.19255"},"observation_digest":"sha256:04cdb70df4a7bb60b362f64cf8a23b430aa935fd11e43e57b2c9161aca6ee6b9","observation_id":"f0cebf4b-e2e1-47b6-830e-0458faf94f32","resolution":{"observed_at":"2026-08-11T00:55:03.976160Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":"2003.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-06-30T13:04:40.447109Z","title":"Talking-heads attention.arXiv preprint arXiv:2003.02436","venue":null,"work_id":"3f1c0158-67c0-4cb4-8aaa-357f85aad2f5","year":2020},"citing_paper":{"arxiv_id":"2604.06291","last_updated":"2026-04-07T14:57:44Z","snapshot_observed_at":"2026-08-14T01:47:31.800378Z","submitted_at":"2026-04-07T14:57:44Z","title":"TalkLoRA: Communication-Aware Mixture of Low-Rank Adaptation for Large Language Models","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T20:17:28.805236Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2604.06291"},"observation_digest":"sha256:291661ebcc64493baf22b7c675d6dd93653dc754d8baa59b1be6866c00093d07","observation_id":"5d5836cf-1de2-4be1-a22c-a0ee6ecd1593","resolution":{"observed_at":"2026-05-10T22:05:47.778068Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":"2003.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-06-30T13:04:40.447109Z","title":"Talking-heads attention.arXiv preprint arXiv:2003.02436","venue":null,"work_id":"3f1c0158-67c0-4cb4-8aaa-357f85aad2f5","year":2020},"citing_paper":{"arxiv_id":"2604.10791","last_updated":"2026-04-12T19:44:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-12T19:44:00Z","title":"Position-Agnostic Pre-Projection for Transformer Attention: Nonlinear Feature Construction and Content Skip Before Q/K/V","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T15:10:01.041823Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2604.10791"},"observation_digest":"sha256:da105b96647b40aae8e9708735986ce6f6d723f06fbd9098718375437d905a15","observation_id":"3d49bedf-ffbc-4334-bfef-eafd0c088e38","resolution":{"observed_at":"2026-05-11T11:06:03.496691Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":"2003.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-06-30T13:04:40.447109Z","title":"Talking-heads attention.arXiv preprint arXiv:2003.02436","venue":null,"work_id":"3f1c0158-67c0-4cb4-8aaa-357f85aad2f5","year":2020},"citing_paper":{"arxiv_id":"2604.19147","last_updated":"2026-04-21T06:54:16Z","snapshot_observed_at":"2026-08-15T05:02:33.133394Z","submitted_at":"2026-04-21T06:54:16Z","title":"Nexusformer: Nonlinear Attention Expansion for Stable and Inheritable Transformer Scaling","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-10T03:14:08.351368Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2604.19147"},"observation_digest":"sha256:ad0f9ea1d3adf7968bba35316247a5b81310b92a54e0931cacd5c59728515df7","observation_id":"d6f93596-cee1-477c-9503-a85583a2f197","resolution":{"observed_at":"2026-05-11T12:41:04.817981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":"2003.02436","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-06-30T13:04:40.447109Z","title":"Talking-heads attention.arXiv preprint arXiv:2003.02436","venue":null,"work_id":"3f1c0158-67c0-4cb4-8aaa-357f85aad2f5","year":2020},"citing_paper":{"arxiv_id":"2605.24754","last_updated":"2026-05-23T22:09:34Z","snapshot_observed_at":"2026-08-14T16:38:36.528139Z","submitted_at":"2026-05-23T22:09:34Z","title":"Motion-Compensated Weight Compression","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-30T12:58:27.637822Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2605.24754"},"observation_digest":"sha256:a952007e72dada2faa4359d3e6396e59e2806c90a0030b82fedc8110e047b63d","observation_id":"b7bf033c-44ef-41b1-bd28-d54797045f57","resolution":{"observed_at":"2026-06-30T13:04:40.448553Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-21T06:32:19.484+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-07-14T07:49:00.628303Z","title":"Talking- heads attention,","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2607.10992","last_updated":"2026-07-13T01:31:01Z","snapshot_observed_at":"2026-08-09T06:13:41.725370Z","submitted_at":"2026-07-13T01:31:01Z","title":"LoSA-Net: A Localized and Scale-Adaptive Network for Boundary-Sensitive Prediction of Perineural Invasion in 3D MRI","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-14T07:49:00.628303Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2607.10992"},"observation_digest":"sha256:d1a134454935e435e47c9c6b6912f77b6fd78e861432d1b929454ef2da1466cf","observation_id":"55154ef0-c3b0-4d2f-a448-6bb413d06f04","resolution":{"observed_at":"2026-07-14T07:49:00.628303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-07-31T23:18:22.002545Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.24015","last_updated":"2026-07-27T05:25:50Z","snapshot_observed_at":"2026-08-20T18:51:31.738545Z","submitted_at":"2026-07-27T05:25:50Z","title":"Mosaic: A Fleet of User Embedding Specialists for Recommendation at Meta","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-31T23:18:22.002545Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2607.24015"},"observation_digest":"sha256:277557c087a6732e677261e1f54a51c24e211b72452944dd139a89e382e85d1a","observation_id":"949d0985-4d61-47f8-9b75-4abdcc3897d8","resolution":{"observed_at":"2026-07-31T23:18:22.002545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.02436","snapshot_observed_at":"2026-08-14T04:15:48.886209Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2608.10288","last_updated":"2026-08-10T22:45:22Z","snapshot_observed_at":"2026-08-19T10:42:58.723488Z","submitted_at":"2026-08-10T22:45:22Z","title":"Power law graph attention: exact generalization of scaled dot-product attention, empirical collapse at inference","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-14T04:15:48.886209Z"},"links":{"cited_paper":"/paper/2003.02436","citing_paper":"/paper/2608.10288"},"observation_digest":"sha256:c52a9b9ff0a4ffaaf80d5d496077b7c1a9efc1aa156efb49031f0902f44cf1f5","observation_id":"f58b5cce-e179-4fe6-8330-c8bd527997c1","resolution":{"observed_at":"2026-08-14T04:15:48.886209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2003.02436/citation-record","integrity":"/paper/2003.02436/integrity","json":"/paper/2003.02436/citation-record.json","paper":"/paper/2003.02436"},"outbound":[],"paper":{"arxiv_id":"2003.02436","last_updated":"2020-03-05T05:17:17Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-14T21:26:04.038149Z","submitted_at":"2020-03-05T05:17:17Z","title":"Talking-Heads Attention"},"reference_resolution":{"displayed":0,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":0,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":0},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-21T06:32:19.484+00:00","source":"crossref"},{"observed_at":"2026-08-21T06:32:16.066871+00:00","source":"retraction_watch"}],"thesis":"As of 22 August 2026, this Paper Citation Record lists 0 of 0 outbound references and 8 inbound Pith citation observations for arXiv:2003.02436."}