{"as_of":"2026-08-23T16:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:2ee2bc422242c7694c88b2b28ac94ecbfa143755290a33d96a376187a9a9e427","coverage":[{"denominator":34,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":34,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T00:02:46.864302Z","state":"measured"},{"denominator":36,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":36,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T17:43:52.716947Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-13T17:48:03.356591Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"cited_work":{"arxiv_id":"2602.11852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.11852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prototype Transformer: Towards language model architectures interpretable by design.arXiv preprint","venue":null,"work_id":"6332417e-a3e1-4337-9d96-6fcff627fb6e","year":2026},"citing_paper":{"arxiv_id":"2604.03850","last_updated":"2026-04-04T20:23:21Z","snapshot_observed_at":"2026-08-15T01:03:28.520510Z","submitted_at":"2026-04-04T20:23:21Z","title":"Collapse-Free Prototype Readout Layer for Transformer Encoders","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T17:43:52.716947Z"},"links":{"cited_paper":"/paper/2602.11852","citing_paper":"/paper/2604.03850"},"observation_digest":"sha256:49838815bb6d32a360d43377583b5520c0072c112d211d54888ac893916e3fbc","observation_id":"4fda4066-2b23-4177-af82-33dbb4f77ae8","resolution":{"observed_at":"2026-06-02T04:04:28.578289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"cited_work":{"arxiv_id":"2602.11852","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2602.11852","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Prototype Transformer: Towards language model architectures interpretable by design.arXiv preprint","venue":null,"work_id":"6332417e-a3e1-4337-9d96-6fcff627fb6e","year":2026},"citing_paper":{"arxiv_id":"2604.23862","last_updated":"2026-05-28T09:21:15Z","snapshot_observed_at":"2026-08-16T07:44:15.995828Z","submitted_at":"2026-04-26T20:09:25Z","title":"Graph Memory Transformer (GMT)","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-08T06:27:32.790728Z"},"links":{"cited_paper":"/paper/2602.11852","citing_paper":"/paper/2604.23862"},"observation_digest":"sha256:18fba2515b767f3419f83aee245ea2c9a30fa0d2af4eb416c0bdb0b0ecdd025f","observation_id":"f31719cd-a815-4e8c-a88d-662a3464dd50","resolution":{"observed_at":"2026-06-02T04:04:28.578289Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2602.11852/citation-record","integrity":"/paper/2602.11852/integrity","json":"/paper/2602.11852/citation-record.json","paper":"/paper/2602.11852"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-03T00:02:44.028573Z","title":"GPT-4 technical report.arXiv preprint arXiv:2303.08774,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.028573Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:1ff4f24000b2ec4e36425a968ba76c82659d53a32f4996bf1465f2f769935603","observation_id":"a1bfac4d-6b43-4614-85e4-264b835edc9d","resolution":{"observed_at":"2026-08-03T00:02:44.028573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.752202Z","title":"in the”, “of the","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.752202Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:e2ea47fa19be3dd4841db2c0110b1d31536231101717049daec2901cffa8069b","observation_id":"af9e2236-62b9-4057-90da-077a4e4f759e","resolution":{"observed_at":"2026-08-03T00:02:46.752202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.576286Z","title":"why does my dog eat poo p?","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.576286Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:d6c55ba6fd45fe4e139739cbbd1e89253ee240eed81fafa4a3705f3e2df5f7c8","observation_id":"f3da37f5-1912-488d-a78c-5bace7c0377c","resolution":{"observed_at":"2026-08-03T00:02:46.576286Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14093","last_updated":"2024-12-20T02:22:19Z","snapshot_observed_at":"2026-08-13T11:12:58.507759Z","submitted_at":"2024-12-18T17:41:24Z","title":"Alignment faking in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.14093","snapshot_observed_at":"2026-08-03T00:02:44.405381Z","title":"Bowman, and Evan Hubinger","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.405381Z"},"links":{"cited_paper":"/paper/2412.14093","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:6e59eb93d3a6d9f27df589c3fdcb84a9b5c1eb833cccaf73bc7d2dba43bf5337","observation_id":"8b5c5f2e-3e6c-48c2-92d8-1952187014cd","resolution":{"observed_at":"2026-08-03T00:02:44.405381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.00752","last_updated":"2024-05-31T17:55:27Z","snapshot_observed_at":"2026-08-17T20:47:46.242385Z","submitted_at":"2023-12-01T18:01:34Z","title":"Mamba: Linear-Time Sequence Modeling with Selective State Spaces","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.00752","snapshot_observed_at":"2026-08-03T00:02:44.447448Z","title":"Mamba: Linear-time sequence modeling with selective state spaces.arXiv preprint arXiv:2312.00752,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.447448Z"},"links":{"cited_paper":"/paper/2312.00752","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:42682ab816c6d29b6723945858a6c8cd03130cb04572328098c5c506794e69a7","observation_id":"adedb359-c754-481d-8284-abb4d84791ec","resolution":{"observed_at":"2026-08-03T00:02:44.447448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:44.501260Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.501260Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:6168c71b6413c3b4b828b9be89155ebda07b6eb9be94f903adad99179fb51aa2","observation_id":"46b28b14-7707-4f1e-a7d1-9d6078015bd1","resolution":{"observed_at":"2026-08-03T00:02:44.501260Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.17759","last_updated":"2024-06-25T17:43:13Z","snapshot_observed_at":"2026-08-16T13:39:40.522215Z","submitted_at":"2024-06-25T17:43:13Z","title":"Interpreting Attention Layer Outputs with Sparse Autoencoders","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.17759","snapshot_observed_at":"2026-08-03T00:02:44.553873Z","title":"In- terpreting attention layer outputs with sparse autoencoders.arXiv preprint arXiv:2406.17759,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.553873Z"},"links":{"cited_paper":"/paper/2406.17759","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:bd6287a23f654e9c1811045beca2fe28682642af4dfdc3c436a138e503df0155","observation_id":"bfe80cb7-8e10-468a-9df2-844fa94f8921","resolution":{"observed_at":"2026-08-03T00:02:44.553873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.05101","last_updated":"2019-01-04T21:01:49Z","snapshot_observed_at":"2026-08-14T20:13:52.872565Z","submitted_at":"2017-11-14T14:24:06Z","title":"Decoupled Weight Decay Regularization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.05101","snapshot_observed_at":"2026-08-03T00:02:44.712646Z","title":"Decoupled weight decay regularization.arXiv preprint arXiv:1711.05101,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.712646Z"},"links":{"cited_paper":"/paper/1711.05101","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:28d71b7f1c6eada5cf8299f00b19ed348366dbc14a153cc84a0429361102e91a","observation_id":"c4374789-4366-41cb-9250-59ca772f2aa5","resolution":{"observed_at":"2026-08-03T00:02:44.712646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07612","last_updated":"2018-04-20T13:44:12Z","snapshot_observed_at":"2026-08-20T00:49:56.855387Z","submitted_at":"2018-04-20T13:44:12Z","title":"Revisiting Small Batch Training for Deep Neural Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07612","snapshot_observed_at":"2026-08-03T00:02:44.801595Z","title":"Revisiting small batch training for deep neural networks.arXiv preprint arXiv:1804.07612,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.801595Z"},"links":{"cited_paper":"/paper/1804.07612","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:961876285f087354242eeed6e67aae6cd94b6c75730a32ed45bf2ae15594bc09","observation_id":"1b0442a0-0e4a-43bc-b578-13a5d9bbdb8b","resolution":{"observed_at":"2026-08-03T00:02:44.801595Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1609.07843","last_updated":"2016-09-26T04:06:13Z","snapshot_observed_at":"2026-08-17T01:46:43.513643Z","submitted_at":"2016-09-26T04:06:13Z","title":"Pointer Sentinel Mixture Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1609.07843","snapshot_observed_at":"2026-08-03T00:02:44.868311Z","title":"Pointer sentinel mixture models.arXiv preprint arXiv:1609.07843,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.868311Z"},"links":{"cited_paper":"/paper/1609.07843","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:9387f675c8fd0b88665340f52f1c49cadfb03edfbef4ce534ba230e7fc2b3be5","observation_id":"fee98cb1-71ec-4910-927b-fcd4aa72dee5","resolution":{"observed_at":"2026-08-03T00:02:44.868311Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:44.980576Z","title":"A practical review of mecha- nistic interpretability for transformer-based language models.arXiv preprint arXiv:2407.02646,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.980576Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:c201953c555f88972b6fa119681748559ae7c8dc9d82ea1df55575d1d625a08a","observation_id":"4fce6703-a533-4f72-8c27-92c5febd96ee","resolution":{"observed_at":"2026-08-03T00:02:44.980576Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:45.106968Z","title":"Sentence-BERT: Sentence embeddings using Siamese BERT- networks","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.106968Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:b2c7d7751411a0f98847591075362ee22cd5f6772682b97b64739ecc33e3f253","observation_id":"a63bffcf-1e9f-4821-adeb-6a6073a781d3","resolution":{"observed_at":"2026-08-03T00:02:45.106968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1508.07909","last_updated":"2016-06-10T14:45:08Z","snapshot_observed_at":"2026-08-17T07:28:37.146698Z","submitted_at":"2015-08-31T16:37:31Z","title":"Neural Machine Translation of Rare Words with Subword Units","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1508.07909","snapshot_observed_at":"2026-08-03T00:02:45.222948Z","title":"Neural machine translation of rare words with subword units.arXiv preprint arXiv:1508.07909,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.222948Z"},"links":{"cited_paper":"/paper/1508.07909","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:ff943388b3ef76044c780ab9bd2143d3b640af6ce32d07915f56489a60c2194a","observation_id":"fc58d4da-ff62-462b-89c8-92d5539d6325","resolution":{"observed_at":"2026-08-03T00:02:45.222948Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-08-20T04:51:51.539700Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-08-03T00:02:45.502617Z","title":"BERT rediscovers the classical NLP pipeline.arXiv preprint arXiv:1905.05950,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.502617Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:6f013724a8dc265cf4cee44fde8d7d518a7fc4760a04ffbc73a09e3973e50ae0","observation_id":"41941a36-071c-442f-a066-8c600b8b94ba","resolution":{"observed_at":"2026-08-03T00:02:45.502617Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-03T00:02:45.649779Z","title":"Llama: Open and efficient foundation language models.arXiv preprint arXiv:2302.13971, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.649779Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:2742eaf78e6fef3577eac526ae0e823c6aa99e326d835489aa2d8f94e2102305","observation_id":"eb975022-1a6e-46f5-adac-0c72f8705585","resolution":{"observed_at":"2026-08-03T00:02:45.649779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1804.07461","last_updated":"2019-02-22T23:53:34Z","snapshot_observed_at":"2026-08-16T09:50:11.319379Z","submitted_at":"2018-04-20T06:35:04Z","title":"GLUE: A Multi-Task Benchmark and Analysis Platform for Natural Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1804.07461","snapshot_observed_at":"2026-08-03T00:02:45.798192Z","title":"GLUE: A multi-task benchmark and analysis platform for natural language understanding.arXiv preprint arXiv:1804.07461,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.798192Z"},"links":{"cited_paper":"/paper/1804.07461","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:0f551663efdd64c31e0fe5b8c44756cb9b3031665b793f01880ec7fddb611683","observation_id":"5148a92f-9c00-473b-864f-105e0c29e300","resolution":{"observed_at":"2026-08-03T00:02:45.798192Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.10957","last_updated":"2020-04-06T02:53:18Z","snapshot_observed_at":"2026-08-14T23:23:42.318384Z","submitted_at":"2020-02-25T15:21:10Z","title":"MiniLM: Deep Self-Attention Distillation for Task-Agnostic Compression of Pre-Trained Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.10957","snapshot_observed_at":"2026-08-03T00:02:46.051367Z","title":"MiniLM: Deep self- attention distillation for task-agnostic compression of pre-trained transformers.arXiv preprint arXiv:2002.10957,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.051367Z"},"links":{"cited_paper":"/paper/2002.10957","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:f1ee6f5c391fc43b987ed0d73b1f7fc1f169e69737e0d35a6a2227a77089ad03","observation_id":"08ba0b77-c02a-48c3-9a40-3b02ad92be0f","resolution":{"observed_at":"2026-08-03T00:02:46.051367Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-03T00:02:46.227111Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.227111Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:78a713220d624d25a517f90365d29bda496bb3cb7421c2913b4ba2dbe33a1417","observation_id":"1ecbbd32-0886-4350-8b15-0a4a915caa04","resolution":{"observed_at":"2026-08-03T00:02:46.227111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.310196Z","title":"Image classification at supercomputer scale","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.310196Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:8484555c1a5cb7caef811f4b1c94c89d32eb8a8418d7c7a56f65f79f86893146","observation_id":"834de153-2f61-4a87-88ae-1c3586f40b90","resolution":{"observed_at":"2026-08-03T00:02:46.310196Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16042","last_updated":"2024-01-17T04:07:06Z","snapshot_observed_at":"2026-08-08T04:58:14.317234Z","submitted_at":"2023-09-27T21:53:56Z","title":"Towards Best Practices of Activation Patching in Language Models: Metrics and Methods","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16042","snapshot_observed_at":"2026-08-03T00:02:46.368866Z","title":"Towards best practices of activation patching in language models: Metrics and methods.arXiv preprint arXiv:2309.16042,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.368866Z"},"links":{"cited_paper":"/paper/2309.16042","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:19517c6f2c0bd1b41dfc1cb50587e247e000d938377fc9c25645b10ac66fd0f6","observation_id":"6bfe7acc-6173-4475-b784-2f6042fd6c09","resolution":{"observed_at":"2026-08-03T00:02:46.368866Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07972","last_updated":"2025-02-28T01:47:44Z","snapshot_observed_at":"2026-08-19T06:02:49.560543Z","submitted_at":"2024-07-10T18:11:40Z","title":"Deconstructing What Makes a Good Optimizer for Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07972","snapshot_observed_at":"2026-08-03T00:02:46.444321Z","title":"Deconstruct- ing what makes a good optimizer for language models.arXiv preprint arXiv:2407.07972,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.444321Z"},"links":{"cited_paper":"/paper/2407.07972","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:9f8998d1249cb87b886173798a37a8d5092be1d18d822a85235c3794182f60c0","observation_id":"e2572600-d266-46aa-9b73-c18d7d38e2fe","resolution":{"observed_at":"2026-08-03T00:02:46.444321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.512106Z","title":"to help us produce the prototype interpretability html","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.512106Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:2a762a7b2550a6faf24a60d1d27454bff7a82720228e84088b98157d5d6974e2","observation_id":"c5bea32e-e11e-4c37-b82f-13aa38042664","resolution":{"observed_at":"2026-08-03T00:02:46.512106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.864302Z","title":"You are analyzing a single prototype (a neuron-like feature) from a neural language model.\\n","venue":null,"work_id":null,"year":1955},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.864302Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:1bb08ae3c9770decdd1a620824c765b6032156d8450c68f5c3c0d0ce5e2dc419","observation_id":"eab81462-3c7d-4139-81fe-216efd394dbb","resolution":{"observed_at":"2026-08-03T00:02:46.864302Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-03T00:02:46.654475Z","title":null,"venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":512,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.654475Z"},"links":{"citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:758cebf71805c69ef96812b6afb24c8aff5d028f995f3530b9eaf76f9eaa69dd","observation_id":"b00eba98-5974-4fa3-a4bd-be6ff0f33e8b","resolution":{"observed_at":"2026-08-03T00:02:46.654475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13928","last_updated":"2025-08-06T13:47:10Z","snapshot_observed_at":"2026-08-16T13:08:17.757544Z","submitted_at":"2024-10-17T17:56:01Z","title":"Automatically Interpreting Millions of Features in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13928","snapshot_observed_at":"2026-08-03T00:02:44.908484Z","title":"Automatically Interpreting Millions of Features in Large Language Models.arXiv preprint arXiv:2410.13928,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":1995,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.908484Z"},"links":{"cited_paper":"/paper/2410.13928","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:a406f2dbdf1f8deb97ea0e713922e0e96056874538dde94d57d25ff17ec0fa6c","observation_id":"40fa6dbd-3e7a-44e4-9b18-20d62b4e15f5","resolution":{"observed_at":"2026-08-03T00:02:44.908484Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.05202","last_updated":"2020-02-12T19:57:13Z","snapshot_observed_at":"2026-08-11T06:21:56.129166Z","submitted_at":"2020-02-12T19:57:13Z","title":"GLU Variants Improve Transformer","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.05202","snapshot_observed_at":"2026-08-03T00:02:45.387740Z","title":"GLU variants improve transformer.arXiv preprint arXiv:2002.05202,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2015,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.387740Z"},"links":{"cited_paper":"/paper/2002.05202","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:a145efbdda76f7132ea178196bf76779e151db90c954f48fe488838d34f0be75","observation_id":"7ced3996-6364-4a23-a77f-5bc065fea788","resolution":{"observed_at":"2026-08-03T00:02:45.387740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.19887","last_updated":"2024-07-03T14:30:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-28T23:55:06Z","title":"Jamba: A Hybrid Transformer-Mamba Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.19887","snapshot_observed_at":"2026-08-03T00:02:44.629564Z","title":"Jamba: A hybrid transformer- mamba language model.arXiv preprint arXiv:2403.19887,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.629564Z"},"links":{"cited_paper":"/paper/2403.19887","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:225c2429a27fd6453081bae191753330bc7fa26197bbde2f0b19f129df5a26c1","observation_id":"020f9809-d3ca-4704-8415-ab7576d37bca","resolution":{"observed_at":"2026-08-03T00:02:44.629564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.00593","last_updated":"2022-11-01T17:08:44Z","snapshot_observed_at":"2026-08-05T06:04:21.031867Z","submitted_at":"2022-11-01T17:08:44Z","title":"Interpretability in the Wild: a Circuit for Indirect Object Identification in GPT-2 small","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.00593","snapshot_observed_at":"2026-08-03T00:02:45.942638Z","title":"Inter- pretability in the wild: A circuit for indirect object identification in GPT-2 small.arXiv preprint arXiv:2211.00593,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:45.942638Z"},"links":{"cited_paper":"/paper/2211.00593","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:ecfadec19f0c00c9b25290516d48697c7add3f867008019a8cb10dfc7e153e6d","observation_id":"26f2a1fc-a6e3-4916-ab4e-87dbfafc3d56","resolution":{"observed_at":"2026-08-03T00:02:45.942638Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2209.10652","last_updated":"2022-09-21T20:49:26Z","snapshot_observed_at":"2026-08-22T06:24:21.120481Z","submitted_at":"2022-09-21T20:49:26Z","title":"Toy Models of Superposition","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2209.10652","snapshot_observed_at":"2026-08-03T00:02:44.238440Z","title":"Toy models of superposi- tion.arXiv preprint arXiv:2209.10652,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.238440Z"},"links":{"cited_paper":"/paper/2209.10652","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:81924a3dee4547c51180748b5634fdb7f9222b30917a6a1d4dfba33a6a55ff04","observation_id":"c653af77-502d-40b8-8e35-261f826ecdd2","resolution":{"observed_at":"2026-08-03T00:02:44.238440Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.04887","last_updated":"2020-06-25T00:09:04Z","snapshot_observed_at":"2026-08-16T14:39:51.085226Z","submitted_at":"2020-03-10T17:58:01Z","title":"ReZero is All You Need: Fast Convergence at Large Depth","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.04887","snapshot_observed_at":"2026-08-03T00:02:44.101431Z","title":"Cottrell, and Julian McAuley","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.101431Z"},"links":{"cited_paper":"/paper/2003.04887","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:e46058a2697414391f5a1e98e7056c143c16440eeb3e18d2f3eb0944c92a7a3a","observation_id":"15f46023-078f-4a3e-ae84-15d5872d299b","resolution":{"observed_at":"2026-08-03T00:02:44.101431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.14767","last_updated":"2023-10-13T19:01:20Z","snapshot_observed_at":"2026-08-16T15:37:00.428813Z","submitted_at":"2023-04-28T11:26:17Z","title":"Dissecting Recall of Factual Associations in Auto-Regressive Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.14767","snapshot_observed_at":"2026-08-03T00:02:44.289013Z","title":"Dissecting recall of factual associations in auto-regressive language models.arXiv preprint arXiv:2304.14767,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.289013Z"},"links":{"cited_paper":"/paper/2304.14767","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:ab4bdaeec80fefaeeafb0d8ddb51e502cfadc676e3e4c01593abdae7a36179fd","observation_id":"75b0f373-ec3b-4ecf-9551-f1139e62d36c","resolution":{"observed_at":"2026-08-03T00:02:44.289013Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-13T17:20:44.002518Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-03T00:02:44.342008Z","title":"The Llama 3 herd of models.arXiv preprint arXiv:2407.21783,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.342008Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:6e1602b166b3b96ddbff031a203a88a41aea75e3ece2302b761f35397e82fc1c","observation_id":"3c45c933-8f46-44dc-921d-f26437a88557","resolution":{"observed_at":"2026-08-03T00:02:44.342008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1906.04341","last_updated":"2019-06-11T01:31:41Z","snapshot_observed_at":"2026-08-16T14:00:03.452025Z","submitted_at":"2019-06-11T01:31:41Z","title":"What Does BERT Look At? An Analysis of BERT's Attention","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1906.04341","snapshot_observed_at":"2026-08-03T00:02:44.176347Z","title":"What does BERT look at? An analysis of BERT’s attention.arXiv preprint arXiv:1906.04341,","venue":null,"work_id":null,"year":1906},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:44.176347Z"},"links":{"cited_paper":"/paper/1906.04341","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:a24ba337ec8b90c0125bdbff3a75951054cfff9900ff1785a1da74a135f6b3c4","observation_id":"51a80759-3718-4f16-ad06-a22a23c087d3","resolution":{"observed_at":"2026-08-03T00:02:44.176347Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.11838","last_updated":"2026-04-20T04:33:33Z","snapshot_observed_at":"2026-08-02T18:44:16.322606Z","submitted_at":"2025-03-14T19:58:43Z","title":"A Transformer and Prototype-based Interpretable Model for Contextual Sarcasm Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.11838","snapshot_observed_at":"2026-08-03T00:02:46.162136Z","title":"A transformer and prototype-based interpretable model for contextual sarcasm detection.arXiv preprint arXiv:2503.11838,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-03T00:02:46.162136Z"},"links":{"cited_paper":"/paper/2503.11838","citing_paper":"/paper/2602.11852"},"observation_digest":"sha256:9b9abfaa72142c093aa3f79148ced0a9063da26df208d896b17332c413460157","observation_id":"94ee83c8-71d3-4a93-938f-b8bb4da36bfc","resolution":{"observed_at":"2026-08-03T00:02:46.162136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2602.11852","last_updated":"2026-06-01T12:42:45Z","latest_version":2,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T05:23:58.271327Z","submitted_at":"2026-02-12T11:43:39Z","title":"Prototype Transformer: Towards Language Model Architectures Interpretable by Design"},"reference_resolution":{"displayed":34,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":34},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 34 of 34 outbound references and 2 inbound Pith citation observations for arXiv:2602.11852."}