{"as_of":"2026-08-11T07:58:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6372bb0d0cb98b74e572d1ebd4309267eec8ecf83131990a4da42a5a22ce967e","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-10T16:17:32.264116Z","state":"measured"},{"denominator":91,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":91,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-11T06:34:44.6726+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-02T18:01:48.915707Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T18:47:17.246744Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"cited_work":{"arxiv_id":"2501.13397","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2501.13397","snapshot_observed_at":"2026-07-02T18:47:17.246744Z","title":"arXiv preprint arXiv:2501.13397 (2025)","venue":null,"work_id":"b32ff79b-1c5b-4662-bf6f-2f8e026821e3","year":2025},"citing_paper":{"arxiv_id":"2607.00052","last_updated":"2026-06-30T01:23:09Z","snapshot_observed_at":"2026-08-02T17:58:34.671249Z","submitted_at":"2026-06-30T01:23:09Z","title":"AGE: Adaptive-masking for Graph Embedding in Graph Retrieval-Augmented Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-02T18:01:48.915707Z"},"links":{"cited_paper":"/paper/2501.13397","citing_paper":"/paper/2607.00052"},"observation_digest":"sha256:8f31070b3a94d0ca3ea8f342835d3727680bf07b5ed858064a6f148db29087c1","observation_id":"366a12e9-abc2-40a9-91ae-b5c34c916199","resolution":{"observed_at":"2026-07-02T18:47:17.248041Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2501.13397/citation-record","integrity":"/paper/2501.13397/integrity","json":"/paper/2501.13397/citation-record.json","paper":"/paper/2501.13397"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.918754Z","title":"Unilmv2: Pseudo-masked language models for unified language model pre-training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.918754Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:0284914f52a324a84ad85de530d73bb5c9b82aeb889a0f6a5796c88e549a1d98","observation_id":"5d468e1e-a564-4700-9790-e55315cd50ce","resolution":{"observed_at":"2026-08-10T16:17:31.918754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2106.08254","last_updated":"2022-09-03T14:11:33Z","snapshot_observed_at":"2026-07-06T11:19:34.705520Z","submitted_at":"2021-06-15T16:02:37Z","title":"BEiT: BERT Pre-Training of Image Transformers","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2106.08254","snapshot_observed_at":"2026-08-10T16:17:31.923360Z","title":"Beit: Bert pre-training of image transformers","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.923360Z"},"links":{"cited_paper":"/paper/2106.08254","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:84577c24f7d017e4dd2967f76f6eac393246357c77fe7523bddd18a7174fd9a4","observation_id":"e9f8f023-5458-475d-82c4-3ba6d3d15c1b","resolution":{"observed_at":"2026-08-10T16:17:31.923360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.927540Z","title":"The fifth pascal recognizing textual entailment challenge","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.927540Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:8cf8ef41f02c9cd429ad47322f95ee0396da439bf20951ddd5ecbbcc73276463","observation_id":"2d3acb42-b358-411b-90c3-48c74c8598e4","resolution":{"observed_at":"2026-08-10T16:17:31.927540Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.931219Z","title":"Semeval-2017 task 1: Semantic textual similarity multilingual and crosslingual focused evaluation","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.931219Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:9721e541432daef59327e9af082d35b9ccb3f76b44f90fafdd48407dd4f7f4ee","observation_id":"fb2d0872-7ed4-4825-b2ee-f670efc7d0ee","resolution":{"observed_at":"2026-08-10T16:17:31.931219Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2010.09885","last_updated":"2020-10-23T04:22:37Z","snapshot_observed_at":"2026-08-08T06:02:13.053327Z","submitted_at":"2020-10-19T21:41:41Z","title":"ChemBERTa: Large-Scale Self-Supervised Pretraining for Molecular Property Prediction","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2010.09885","snapshot_observed_at":"2026-08-10T16:17:31.935387Z","title":"Chemberta: large-scale self-supervised pretraining for molecular property prediction","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.935387Z"},"links":{"cited_paper":"/paper/2010.09885","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:72f6ef576ece2d0cd98894f65be9b35c0e1ce975f3c3115916d2476c6e89e524","observation_id":"c9341914-2ed4-4eab-9e21-bf0448a4721b","resolution":{"observed_at":"2026-08-10T16:17:31.935387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2003.10555","last_updated":"2020-03-23T21:17:42Z","snapshot_observed_at":"2026-08-06T14:37:14.514749Z","submitted_at":"2020-03-23T21:17:42Z","title":"ELECTRA: Pre-training Text Encoders as Discriminators Rather Than Generators","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2003.10555","snapshot_observed_at":"2026-08-10T16:17:31.939541Z","title":"Electra: Pre-training text encoders as discriminators rather than generators","venue":null,"work_id":null,"year":2003},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.939541Z"},"links":{"cited_paper":"/paper/2003.10555","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:74ba5e60346bcaadacc2b47f751a22506a0d20b4ba4e611cb8d77e534d2df970","observation_id":"b9347186-56f2-42e9-88fd-4f6aa0eb7e90","resolution":{"observed_at":"2026-08-10T16:17:31.939541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.943972Z","title":"The pascal recognising textual entailment challenge","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.943972Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:512c82326a45cd8d6ca5d588f367b1872fc0b16f54579e3f597e67c2fa2a40a5","observation_id":"56f974e4-bf9a-41a2-8386-fd9bfb4e4baa","resolution":{"observed_at":"2026-08-10T16:17:31.943972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.00286","last_updated":"2022-03-02T12:16:17Z","snapshot_observed_at":"2026-08-10T22:40:06.815432Z","submitted_at":"2022-03-01T08:24:56Z","title":"\"Is Whole Word Masking Always Better for Chinese BERT?\": Probing on Chinese Grammatical Error Correction","version":2},"cited_work":{"arxiv_id":"2203.00286","doi":null,"metadata_source":"pith","pith_arxiv_id":"2203.00286","snapshot_observed_at":"2026-08-10T16:17:32.717970Z","title":"\"Is Whole Word Masking Always Better for Chinese BERT?\": Probing on Chinese Grammatical Error Correction","venue":"cs.CL","work_id":"76bac40c-c829-4519-85fa-9975c0858a15","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.947443Z"},"links":{"cited_paper":"/paper/2203.00286","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d6f136fae29ec695eb9fec73bdad8cabfb66007988c75c697c64eb59a1d9013c","observation_id":"441949a8-bd83-4967-af41-615f98cf9a35","resolution":{"observed_at":"2026-08-10T16:17:32.722731Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.04805","last_updated":"2019-05-24T20:37:26Z","snapshot_observed_at":"2026-07-30T09:12:38.100527Z","submitted_at":"2018-10-11T00:50:01Z","title":"BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1810.04805","snapshot_observed_at":"2026-08-10T16:17:31.951230Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.951230Z"},"links":{"cited_paper":"/paper/1810.04805","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:42e944d9ce8ea8cf280795077de08f8292af33d519dc614f8034c134c7c785a1","observation_id":"a4d3e7d7-c7ef-4b1a-aa9e-3dcbf3ed2a32","resolution":{"observed_at":"2026-08-10T16:17:31.951230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.955029Z","title":null,"venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.955029Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:039e494af815d45fd5dcfef052496a40c3d7fa2b01718d20e066523d9114961a","observation_id":"8cfcdd2a-2a9f-4db6-83a0-6697fcb26714","resolution":{"observed_at":"2026-08-10T16:17:31.955029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.958119Z","title":"Unified language model pre-training for natural language understanding and generation","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.958119Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d41ae3321b02ce8e8c0d0c20f6c292b950a030295229743aba71b8747557d207","observation_id":"b94e096e-d78d-4d44-b17f-9167dc9fae29","resolution":{"observed_at":"2026-08-10T16:17:31.958119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2103.10360","last_updated":"2022-03-17T11:49:55Z","snapshot_observed_at":"2026-07-06T10:51:12.871009Z","submitted_at":"2021-03-18T16:30:26Z","title":"GLM: General Language Model Pretraining with Autoregressive Blank Infilling","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2103.10360","snapshot_observed_at":"2026-08-10T16:17:31.961086Z","title":"Glm: General language model pretraining with autoregressive blank infilling","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.961086Z"},"links":{"cited_paper":"/paper/2103.10360","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:de778c46a7a02f97da65f75ccaac9ec2741f745b303828923f06f050e86d57f2","observation_id":"d139b717-825b-41ef-9386-34aae2436ec8","resolution":{"observed_at":"2026-08-10T16:17:31.961086Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.964621Z","title":"Prottrans: Toward understanding the language of life through self-supervised learning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.964621Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:bc44e9d26bde084c8fe46ebeb2ae7b3fb5b0cb80fffced6ee5f0153589c87a26","observation_id":"f0142acb-793e-4d85-8155-458e9400d539","resolution":{"observed_at":"2026-08-10T16:17:31.964621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.967991Z","title":"A bioactivity foundation model using pairwise meta-learning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.967991Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:084ebb7ab9cfddd2bc01611d00e7e0163f78c94735e626f62126ca34a5f71760","observation_id":"e3bb3661-8f27-447b-bc19-b84472ee8ade","resolution":{"observed_at":"2026-08-10T16:17:31.967991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2002.08155","last_updated":"2020-09-18T15:38:12Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-02-19T13:09:07Z","title":"CodeBERT: A Pre-Trained Model for Programming and Natural Languages","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.08155","snapshot_observed_at":"2026-08-10T16:17:31.971239Z","title":"Codebert: A pre-trained model for programming and natural languages","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.971239Z"},"links":{"cited_paper":"/paper/2002.08155","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:9d5ca0b717bfb33230536866c21de2186e1f995bdb9b6e22814cce4955b13d10","observation_id":"033f21ce-7af5-41f9-8136-514c4ac1116f","resolution":{"observed_at":"2026-08-10T16:17:31.971239Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.04163","last_updated":"2022-04-08T16:18:06Z","snapshot_observed_at":"2026-08-07T01:07:18.959970Z","submitted_at":"2022-04-08T16:18:06Z","title":"Contextual Representation Learning beyond Masked Language Modeling","version":1},"cited_work":{"arxiv_id":"2204.04163","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.04163","snapshot_observed_at":"2026-08-10T16:17:32.664533Z","title":"Contextual Representation Learning beyond Masked Language Modeling","venue":"cs.CL","work_id":"0e759bb2-34b1-4de7-bad7-6743dfe8345c","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.974766Z"},"links":{"cited_paper":"/paper/2204.04163","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:2ea2f46aab57efc880aa647800db0543b114353ed1ac8110f9e87255dd6357c5","observation_id":"c75eb524-f68b-4ac2-8965-ad93c8cadb18","resolution":{"observed_at":"2026-08-10T16:17:32.668707Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.978563Z","title":"The third pascal recognizing textual entailment challenge","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.978563Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7aa21c0e0442d98897bda320ec013b6e1baa62f0ccc0307d9347dcfee020d52f","observation_id":"56137fbd-c81d-403a-85fd-47734bcf72ec","resolution":{"observed_at":"2026-08-10T16:17:31.978563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.982131Z","title":"Connectionist temporal classification: labelling unsegmented sequence data with recurrent neural networks","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.982131Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:bd2f6d483a4be111d03023d951264c9cc4980e6d4e3875c8622243f496a0b723","observation_id":"32899db7-00b3-4f0d-9274-751d2011b0e7","resolution":{"observed_at":"2026-08-10T16:17:31.982131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1711.02281","last_updated":"2018-03-09T03:37:52Z","snapshot_observed_at":"2026-08-05T03:59:33.681648Z","submitted_at":"2017-11-07T04:42:48Z","title":"Non-Autoregressive Neural Machine Translation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.02281","snapshot_observed_at":"2026-08-10T16:17:31.985409Z","title":"O., and Socher, R","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.985409Z"},"links":{"cited_paper":"/paper/1711.02281","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:76ce96d3394ee94354241b3a68222f81eae323ea5822b3c2b7cc3cfb7beeed14","observation_id":"bf5eda30-e2a9-4ac8-8f35-948fbd5a6711","resolution":{"observed_at":"2026-08-10T16:17:31.985409Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.08366","last_updated":"2021-09-13T05:48:51Z","snapshot_observed_at":"2026-07-06T09:56:32.308108Z","submitted_at":"2020-09-17T15:25:56Z","title":"GraphCodeBERT: Pre-training Code Representations with Data Flow","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.08366","snapshot_observed_at":"2026-08-10T16:17:31.989124Z","title":"Graphcodebert: Pre-training code representations with data flow","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.989124Z"},"links":{"cited_paper":"/paper/2009.08366","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:65f8bfcc4c45022b68c4f4875fe0e145b67e7611785252a3d3084999518f85cb","observation_id":"60d7c9ce-00cb-43bb-893b-d7fb6ce3f219","resolution":{"observed_at":"2026-08-10T16:17:31.989124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.265549Z","title":"B., Dagan, I., Dolan, B., Ferro, L., Giampiccolo, D., Magnini, B., and Szpektor, I","venue":null,"work_id":"026cf245-93db-4986-a26c-2ba0a7b17643","year":2006},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.992642Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:597623573f816f809d17894d6aaca2acf46632ee932a78107637e2856715154d","observation_id":"cca050c6-7fcc-4c52-ba5b-7b2704325d0c","resolution":{"observed_at":"2026-08-10T16:17:33.270920Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:31.996202Z","title":"J., Oktay, D., Lin, Z., Verkuil, R., Tran, V","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:31.996202Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d7f53c69b7c64371738061e2138f935c0f564909cd1b3add1e367b20c59decd7","observation_id":"3e0add3c-b7fe-4066-b3be-32b02b0e940a","resolution":{"observed_at":"2026-08-10T16:17:31.996202Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.246322Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"cf4104f0-7464-4619-b9f3-ca1ae3271f49","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.000780Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:ab2df4d821ec5a016742dbec8643cc2cc9653af35c1dfe09f3166c827c84d654","observation_id":"30aa1513-1d8d-4a92-af88-9b7eee3ab2da","resolution":{"observed_at":"2026-08-10T16:17:33.250553Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T16:17:32.004551Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.004551Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7f59a0005f2517f65ded8bc6ac0d19ffb47552c0e8b953d0b49e6ba29523abef","observation_id":"f52e1a4f-8b4c-45db-8cbd-8307c47d792e","resolution":{"observed_at":"2026-08-10T16:17:32.004551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.09543","last_updated":"2023-03-24T09:17:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-11-18T06:48:00Z","title":"DeBERTaV3: Improving DeBERTa using ELECTRA-Style Pre-Training with Gradient-Disentangled Embedding Sharing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.09543","snapshot_observed_at":"2026-08-10T16:17:32.008448Z","title":"Debertav3: Improving deberta using electra-style pre-training with gradient-disentangled embedding sharing","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.008448Z"},"links":{"cited_paper":"/paper/2111.09543","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d301358ba0943545025d6c37881e3d3e79a280fa5928c13d52b3d5d00d5d8308","observation_id":"871b8d61-3b56-4996-9ff6-8af4d8441c27","resolution":{"observed_at":"2026-08-10T16:17:32.008448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2211.15029","last_updated":"2022-11-30T15:41:24Z","snapshot_observed_at":"2026-08-04T09:42:38.461420Z","submitted_at":"2022-11-28T03:25:49Z","title":"DiffusionBERT: Improving Generative Masked Language Models with Diffusion Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2211.15029","snapshot_observed_at":"2026-08-10T16:17:32.013418Z","title":"Diffusionbert: Improving generative masked language models with diffusion models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.013418Z"},"links":{"cited_paper":"/paper/2211.15029","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:57ca21f76709a1a63b4572edd6649c584b8b6b0c8166c33a25df1ec322c5244a","observation_id":"58071825-4468-458b-9742-79ef9fe2ab89","resolution":{"observed_at":"2026-08-10T16:17:32.013418Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.017383Z","title":"Long short-term memory","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.017383Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d1e59f29c79a46a40cfc08c2381e72c2340afc2ae39627178c2825adcf7f991a","observation_id":"67f8e162-4f93-4b1f-896f-cc9542a05732","resolution":{"observed_at":"2026-08-10T16:17:32.017383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.findings-emnlp.677","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.309948Z","title":"A decoding algorithm for length-control summarization based on directed acyclic transformers","venue":null,"work_id":"e784f533-68bb-407e-be1f-e6177383c686","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.021467Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:732786ae297ab67999a7081282e6412ba6a9227da3ca556616f9845d607edf5d","observation_id":"c9a7d056-f785-46b6-babc-7f56395d8c6c","resolution":{"observed_at":"2026-08-10T16:17:32.316030Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.224971Z","title":"Directed acyclic transformer for non-autoregressive machine translation","venue":null,"work_id":"8d69b2b5-18a4-47cd-9a6b-dd9fddc0b87c","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.025221Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:13a3c82b3629ce0002061b6c5c7d1a204db1bfd510f453b5cc776cc81e18add8","observation_id":"d5b3ddfb-f992-4c45-9740-5f770c67f3f9","resolution":{"observed_at":"2026-08-10T16:17:33.229128Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.211266Z","title":"Directed acyclic transformer pre-training for high-quality non-autoregressive text generation","venue":null,"work_id":"219f6578-71c2-4834-90bf-dbd670326535","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.029007Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:04a24657126f5c5a46c5874b15b4c0eb63e1271c47bccc84e8713e115b7f3668","observation_id":"82e26d94-f50c-45ba-9499-eebccfeed118","resolution":{"observed_at":"2026-08-10T16:17:33.216481Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.16645","last_updated":"2023-07-31T13:26:03Z","snapshot_observed_at":"2026-08-01T09:03:35.501236Z","submitted_at":"2023-07-31T13:26:03Z","title":"Scaling Sentence Embeddings with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.16645","snapshot_observed_at":"2026-08-10T16:17:32.032718Z","title":"Scaling sentence embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.032718Z"},"links":{"cited_paper":"/paper/2307.16645","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c5dfb217e391b68f27cceb9862ed1c0e7213d95a9ad6dc866dbf254efc6f0f27","observation_id":"11e08291-94de-4e10-be1b-b98d16c45976","resolution":{"observed_at":"2026-08-10T16:17:32.032718Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.197472Z","title":"S., Zettlemoyer, L., and Levy, O","venue":null,"work_id":"716c7fa6-6439-40cb-b587-5bb2748e2877","year":2020},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.036588Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:6e3614aa090c5486302dcafe1014c36ad0822db4efaa874e14fc95fe5494cc1c","observation_id":"d7613b43-a634-43d6-b9e6-df6eddaafa15","resolution":{"observed_at":"2026-08-10T16:17:33.201951Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.15595","last_updated":"2021-03-15T07:56:22Z","snapshot_observed_at":"2026-08-10T13:04:19.097027Z","submitted_at":"2020-06-28T13:11:02Z","title":"Rethinking Positional Encoding in Language Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.15595","snapshot_observed_at":"2026-08-10T16:17:32.040364Z","title":"Rethinking positional encoding in language pre-training","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.040364Z"},"links":{"cited_paper":"/paper/2006.15595","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c55fb1456c8be1d6e5970390ba5dff8619b50d84c3eababa25a2f778888fecf5","observation_id":"984ea678-f3a4-4ba0-a87b-8c6e9bda8a57","resolution":{"observed_at":"2026-08-10T16:17:32.040364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-10T16:17:32.044485Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.044485Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:e4a2bbb26e35b698299b3783cf81647d1292c2b438fa1255b655440f6bac468a","observation_id":"56102e31-7341-4b94-b526-f3d2bd83e847","resolution":{"observed_at":"2026-08-10T16:17:32.044485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1909.11942","last_updated":"2020-02-09T03:00:18Z","snapshot_observed_at":"2026-07-06T08:24:44.631342Z","submitted_at":"2019-09-26T07:06:13Z","title":"ALBERT: A Lite BERT for Self-supervised Learning of Language Representations","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1909.11942","snapshot_observed_at":"2026-08-10T16:17:32.048155Z","title":"Albert: A lite bert for self-supervised learning of language representations","venue":null,"work_id":null,"year":1909},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.048155Z"},"links":{"cited_paper":"/paper/1909.11942","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:87e435a6d484d44ad4a311a173c7cf53746a9b321db684c0aa2d606f732009a2","observation_id":"4bededfd-0077-40a8-b002-853bdc330210","resolution":{"observed_at":"2026-08-10T16:17:32.048155Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.184939Z","title":"and Li, J","venue":null,"work_id":"8dbf021c-e8df-4b3e-8c09-d27154a029b1","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.051915Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7db928c8d6359331a921616fd903bed4efd3d0e5fc9e72f24e52b2ccbcfc9c8f","observation_id":"25b55773-a7a3-4331-806b-094dcf00e0ae","resolution":{"observed_at":"2026-08-10T16:17:33.188688Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2211.04898","last_updated":"2022-11-15T17:56:25Z","snapshot_observed_at":"2026-08-01T22:36:06.442202Z","submitted_at":"2022-11-09T14:03:22Z","title":"Mask More and Mask Later: Efficient Pre-training of Masked Language Models by Disentangling the [MASK] Token","version":2},"cited_work":{"arxiv_id":"2211.04898","doi":null,"metadata_source":"pith","pith_arxiv_id":"2211.04898","snapshot_observed_at":"2026-08-10T16:17:32.542488Z","title":"Mask More and Mask Later: Efficient Pre-training of Masked Language Models by Disentangling the [MASK] Token","venue":"cs.CL","work_id":"01458d40-661a-429d-9ca7-4b3094a51429","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.055724Z"},"links":{"cited_paper":"/paper/2211.04898","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:9725262b563a39856c4a555882629ef608191b18bf6d1974208a7a3824cf25c0","observation_id":"c4fa5342-c160-4e18-a51b-4b0a3614fbfd","resolution":{"observed_at":"2026-08-10T16:17:32.546815Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.172713Z","title":"Language models of protein sequences at the scale of evolution enable accurate structure prediction","venue":null,"work_id":"c9e0785c-ee73-47f1-b8a0-45a1dc70a04b","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.059342Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:edb80a08209ced5589bd50bf0e58d359a25e9178b3a778aa812b6bf60818ed3d","observation_id":"00e846d1-180d-4d81-9c33-01c57a79b29e","resolution":{"observed_at":"2026-08-10T16:17:33.176929Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.062615Z","title":"Evolutionary-scale prediction of atomic-level protein structure with a language model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.062615Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:01be749a95def44975a0df58e0c7e27c68f35a1ffafb6f49959782d19423d539","observation_id":"5292be1b-fd7b-4722-aa5f-89d872fba6d0","resolution":{"observed_at":"2026-08-10T16:17:32.062615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.153323Z","title":"F., and Liang, Y","venue":null,"work_id":"38ec6dd1-c3fe-4c2c-9680-a3693d32ce41","year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.065873Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:2a8cb85706fa1c8d8293a2cb248d703cfb57aae5e4454facca1f134e61444bbc","observation_id":"0a74d3c8-83e8-4255-beed-79e454c9ea11","resolution":{"observed_at":"2026-08-10T16:17:33.157082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2110.07728","last_updated":"2022-05-29T13:01:37Z","snapshot_observed_at":"2026-08-10T04:48:22.181481Z","submitted_at":"2021-10-07T17:48:57Z","title":"Pre-training Molecular Graph Representation with 3D Geometry","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.07728","snapshot_observed_at":"2026-08-10T16:17:32.069518Z","title":"Pre-training molecular graph representation with 3d geometry","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.069518Z"},"links":{"cited_paper":"/paper/2110.07728","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:799c0375905cd0eb8f22943eb8493caadede9eb81286b5ddfa886bd8b2b38198","observation_id":"83fec895-8b63-446d-9f28-a9218b7f743b","resolution":{"observed_at":"2026-08-10T16:17:32.069518Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-10T16:17:32.073453Z","title":"Roberta: A robustly optimized bert pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.073453Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:0b877e0f85d6a33cefc5d5b1f62a31478f5c872cfea007e0f1adcfcb05e0d71a","observation_id":"9e1e31f6-5571-4c4c-94b3-3ccf56429338","resolution":{"observed_at":"2026-08-10T16:17:32.073453Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2204.03243","last_updated":"2022-04-07T06:19:06Z","snapshot_observed_at":"2026-07-06T12:57:44.025473Z","submitted_at":"2022-04-07T06:19:06Z","title":"Pretraining Text Encoders with Adversarial Mixture of Training Signal Generators","version":1},"cited_work":{"arxiv_id":"2204.03243","doi":null,"metadata_source":"pith","pith_arxiv_id":"2204.03243","snapshot_observed_at":"2026-08-10T16:17:32.503356Z","title":"Pretraining Text Encoders with Adversarial Mixture of Training Signal Generators","venue":"cs.CL","work_id":"8c95aa72-65b8-485e-b7b4-cacb70deb5d2","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.077204Z"},"links":{"cited_paper":"/paper/2204.03243","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:28135ad982f3627bcb6b22ceea98aeb09c019c0a0577761a60d339fb3a3123b2","observation_id":"5cf5fcbb-37bf-481e-8f82-a3f13e8e86f4","resolution":{"observed_at":"2026-08-10T16:17:32.507401Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.02060","last_updated":"2024-03-16T04:28:35Z","snapshot_observed_at":"2026-08-06T02:59:33.349040Z","submitted_at":"2023-02-04T01:54:17Z","title":"Representation Deficiency in Masked Language Modeling","version":2},"cited_work":{"arxiv_id":"2302.02060","doi":null,"metadata_source":"pith","pith_arxiv_id":"2302.02060","snapshot_observed_at":"2026-08-10T16:17:32.486027Z","title":"Representation Deficiency in Masked Language Modeling","venue":"cs.CL","work_id":"667c19e9-98a8-4d48-a0b8-cf13a64fce9b","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.080843Z"},"links":{"cited_paper":"/paper/2302.02060","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:668425beda09d1ffdb79f7dcbcf2fdff3644b100606413b58decdc009fdaa000","observation_id":"eff0e9ef-bcfe-4f42-b5ff-99c855565506","resolution":{"observed_at":"2026-08-10T16:17:32.490089Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.141217Z","title":"Warped language models for noise robust language understanding","venue":null,"work_id":"e4f5230b-f22a-410a-ae30-4995274c4537","year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.084576Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:d7bc332f4fef5441bca9ddf71284de83664fca5004c471b3e8a7d1b888b25296","observation_id":"be5c89df-80f8-46d3-a54b-377d2c787953","resolution":{"observed_at":"2026-08-10T16:17:33.145874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.129098Z","title":"Large language model for molecular chemistry","venue":null,"work_id":"ef8116cf-202c-4a84-9a04-622d73f20dd5","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.088135Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:4ac66a3929769f3f63dd178bc9659ac3f8a705dc53860a109b2de705587ec6ee","observation_id":"fad13cb9-5d03-4fbf-9c74-2ed40d2d2aad","resolution":{"observed_at":"2026-08-10T16:17:33.132991Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1912.01703","last_updated":"2019-12-03T22:06:05Z","snapshot_observed_at":"2026-07-06T08:41:49.632205Z","submitted_at":"2019-12-03T22:06:05Z","title":"PyTorch: An Imperative Style, High-Performance Deep Learning Library","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1912.01703","snapshot_observed_at":"2026-08-10T16:17:32.091575Z","title":"Pytorch: An imperative style, high-performance deep learning library","venue":null,"work_id":null,"year":1912},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.091575Z"},"links":{"cited_paper":"/paper/1912.01703","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:9ae8ee59c5461d64df41a42273d8e26e458aed25bce22dcabb02223ca13ca1f1","observation_id":"db8fdbf7-33ba-4b8f-a0fc-2ccea1de5176","resolution":{"observed_at":"2026-08-10T16:17:32.091575Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.095675Z","title":"E., Neumann, M., Iyyer, M., Gardner, M., Clark, C., Lee, K., and Zettlemoyer, L","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.095675Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:f5ffdd609a2542d245e9b5fd022606f7da645ec3c4b4a647aadb8bd01612bc46","observation_id":"8a87a6f0-1f13-4ae2-8af9-80be1f489dcd","resolution":{"observed_at":"2026-08-10T16:17:32.095675Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.116674Z","title":"Know what you don’t know: Unanswerable questions for SQuAD","venue":null,"work_id":"e3155906-c5f2-480c-a51d-4c4e61ae61e9","year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.099546Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:f92ca88effb228fec5bc0d9540d0d8f48a56767eac8d07f949765359a2d46edf","observation_id":"6fe63ca3-8515-4f38-a4df-317b6f2b73d5","resolution":{"observed_at":"2026-08-10T16:17:33.121085Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.102181Z","title":"Representation learning with large language models for recommendation","venue":null,"work_id":"9398701c-9e43-48a5-a0e3-4f312d87d6ef","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.103584Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:0b706cd8f4ebf49ad231588514d9a835c47810ec9c69c1f248014a47811aa0b4","observation_id":"8294189e-2997-48d4-a496-cc994b8cb20e","resolution":{"observed_at":"2026-08-10T16:17:33.106339Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.088119Z","title":"Self-supervised graph transformer on large-scale molecular data","venue":null,"work_id":"c0e63999-aedd-4a70-b01f-2d34b580ced5","year":2020},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.108272Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:358fef4ebea1364ff7fc409f7e1c5ba776a04bccb000a57c11621715b3c2094d","observation_id":"1d7383d3-252a-4e50-9b0d-eb0fae6453f4","resolution":{"observed_at":"2026-08-10T16:17:33.093109Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.075546Z","title":"Large-scale chemical language representations capture molecular structure and properties","venue":null,"work_id":"bbdc6b24-85f2-41d1-83d9-7cbed45b9d7a","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.111892Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:ca62c2ce863fd0d943741322ac8cdff0afbf3b882b966b462130af7daa2939e9","observation_id":"27235c6a-58c6-4b44-95b3-2e49f24228e3","resolution":{"observed_at":"2026-08-10T16:17:33.079885Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.116036Z","title":"Non-autoregressive machine translation with latent alignments","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.116036Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:1c33b900112d13dfb733b8ba4d84fb20462e04cd47eccd64e2e221eb9166fff0","observation_id":"08374af4-c57d-483f-b331-515edcff13e3","resolution":{"observed_at":"2026-08-10T16:17:32.116036Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.062749Z","title":"found in translation","venue":null,"work_id":"2d08c44a-fa95-4141-a1fe-a59bb728d175","year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.120397Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:e6cb91113dde9c13c1e893c7820b7e2c3ab43248ee79cf7e00e93face9ada5f5","observation_id":"18b37f20-a42a-4343-b66d-83fce0e0d1bc","resolution":{"observed_at":"2026-08-10T16:17:33.066583Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.049452Z","title":"First Quora dataset release: Question pairs, 2017","venue":null,"work_id":"4fa3da60-ace7-485b-9143-cec5179fa6d7","year":2017},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.124907Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:e67363ee94f822a5a161434e28780f5987861e86d752a136d364702abba56559","observation_id":"bd0aaa08-7f6c-4193-85d2-f19fdc6b2145","resolution":{"observed_at":"2026-08-10T16:17:33.053916Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.032789Z","title":"Viterbi decoding of directed acyclic transformer for non-autoregressive machine translation","venue":null,"work_id":"8e885d06-133b-4fa2-b2fc-8e95a5f51cc4","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.129097Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:4da45409f15909cc1faa8a7f1b3ec50fc37b6ee6accd1484c39256c9771c1c29","observation_id":"3633d59e-91a2-4a88-8fd1-a322f3a07243","resolution":{"observed_at":"2026-08-10T16:17:33.037663Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08097","last_updated":"2020-04-17T07:43:38Z","snapshot_observed_at":"2026-07-06T09:13:03.901730Z","submitted_at":"2020-04-17T07:43:38Z","title":"Fast and Accurate Deep Bidirectional Language Representations for Unsupervised Learning","version":1},"cited_work":{"arxiv_id":"2004.08097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2004.08097","snapshot_observed_at":"2026-08-10T16:17:32.459176Z","title":"Fast and Accurate Deep Bidirectional Language Representations for Unsupervised Learning","venue":"cs.CL","work_id":"c4241208-18d8-4a12-b0b4-29c172020f2e","year":2020},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.132903Z"},"links":{"cited_paper":"/paper/2004.08097","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:29b2cba9f1b5fba7c9d982dcff5470bac705d10b8ebea27fe6fe4928559a55aa","observation_id":"fbfb09a0-5a2c-4b51-8482-3fde771becc7","resolution":{"observed_at":"2026-08-10T16:17:32.463576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.020473Z","title":"D., Ng, A","venue":null,"work_id":"a3ef9349-1a08-4bea-a798-4a4055e28a43","year":2013},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.137622Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:dc23be6c4e9afa34b324d25e80f24d0791d1c0381d59ea54e7e625f2dbb57db0","observation_id":"05f93128-46f7-4dcc-9789-0cf7893c50fb","resolution":{"observed_at":"2026-08-10T16:17:33.024343Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.15449","last_updated":"2025-09-07T18:50:16Z","snapshot_observed_at":"2026-08-08T06:06:41.534202Z","submitted_at":"2024-02-23T17:25:10Z","title":"Repetition Improves Language Model Embeddings","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.15449","snapshot_observed_at":"2026-08-10T16:17:32.141217Z","title":"M., Kotha, S., Fried, D., Neubig, G., and Raghunathan, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.141217Z"},"links":{"cited_paper":"/paper/2402.15449","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:79e7c341ddd0d3324219bddca27e04e1f4c4e4956844889410a2d7bd4383579e","observation_id":"b372e310-ec1c-4ca0-9aca-53629e7d20a4","resolution":{"observed_at":"2026-08-10T16:17:32.141217Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:33.007709Z","title":"a rk, H., Beaini, D., Corso, G., Tossou, P., Dallago, C., G \\","venue":null,"work_id":"a571383d-7e75-4d89-9982-e12b705c707e","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.145451Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7b6bf400ad923d3315fd854e8e5e1c398996b2b98f8e72fe50cab493476b9f61","observation_id":"3e11f97f-777c-4598-9fdf-5bafe065208e","resolution":{"observed_at":"2026-08-10T16:17:33.012331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-07-06T11:01:58.137141Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.09864","snapshot_observed_at":"2026-08-10T16:17:32.149452Z","title":"Roformer: Enhanced transformer with rotary position embedding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.149452Z"},"links":{"cited_paper":"/paper/2104.09864","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c3b3254796221b22fc34ccdfaa25b613f80ab7756e1652d1329e983d02e759d0","observation_id":"6febca77-02f5-4e2c-b598-8d9f64853ff9","resolution":{"observed_at":"2026-08-10T16:17:32.149452Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.153301Z","title":"Saprot: Protein language modeling with structure-aware vocabulary","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.153301Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:85f0011c2f92e9a2b6330cc885ec7b1b7106c1d5afa03991d3af3f95f0b4f022","observation_id":"6252ae19-9ea7-4197-bd6c-5f134dea6b8a","resolution":{"observed_at":"2026-08-10T16:17:32.153301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.156818Z","title":"V., Xiao, L., Chopra, A., Chaffin, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.156818Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:ffd15fc4e9e3525685373ce7f8c951912022890c2c21bc9c135e05b7641e43bc","observation_id":"56f3bebf-1b13-4de7-9278-d39e9ede56b6","resolution":{"observed_at":"2026-08-10T16:17:32.156818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.161223Z","title":"Videomae: Masked autoencoders are data-efficient learners for self-supervised video pre-training","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.161223Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:54d85fb0b0ed19370419a02a5b18366ae4dd856116b53f0df812a41f329d27fc","observation_id":"2c30fbbf-e468-4dce-af5b-ff7bdb225b56","resolution":{"observed_at":"2026-08-10T16:17:32.161223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.165136Z","title":"N., Kaiser, ., and Polosukhin, I","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.165136Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:79c1b42793fd7bb20256a883506592c7b0f585f6af7f312a2a124ebb29a357de","observation_id":"ffd11c12-d2fd-443e-b9e4-d98da7393543","resolution":{"observed_at":"2026-08-10T16:17:32.165136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.965025Z","title":null,"venue":null,"work_id":"aba90229-4092-4ebe-bed4-c66ca0b70758","year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.169074Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:4fa6ca8f70fbe98c5ed14fcdea41577a5ef5c95b6111a12eb3630963bd73075b","observation_id":"72131843-d838-4132-9096-c7693466dff7","resolution":{"observed_at":"2026-08-10T16:17:32.968883Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.00368","last_updated":"2024-05-31T07:22:01Z","snapshot_observed_at":"2026-08-10T01:59:33.502428Z","submitted_at":"2023-12-31T02:13:18Z","title":"Improving Text Embeddings with Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.00368","snapshot_observed_at":"2026-08-10T16:17:32.173242Z","title":"Improving text embeddings with large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.173242Z"},"links":{"cited_paper":"/paper/2401.00368","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:23027d0ba7498c1f40f5167dabbbac7306e3a2a1c5eedf2ef8138f58668ef1de","observation_id":"2882b8e2-ab8a-4925-bd45-fb0ae02bcb9a","resolution":{"observed_at":"2026-08-10T16:17:32.173242Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.952883Z","title":"Bevt: Bert pretraining of video transformers","venue":null,"work_id":"543f163c-5329-432e-a515-96c977787d19","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.177482Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:f5a52b7f171545adf154624006845f7662b0816b9a298fcc443d38f16dc51747","observation_id":"94d1c2a5-fc41-4887-9c5d-855d1e2c4fe3","resolution":{"observed_at":"2026-08-10T16:17:32.957024Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.940165Z","title":"Smiles-bert: large scale unsupervised pre-training for molecular property prediction","venue":null,"work_id":"69fa6264-7078-4024-b780-acd60df98c99","year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.181888Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:2955edea2c3e6848d7700d2913e54da703b4d44ae87c5174314c55cbf20b1cab","observation_id":"d6a1b09c-0501-4357-9f7d-828e7bf70d0b","resolution":{"observed_at":"2026-08-10T16:17:32.944950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.18567","last_updated":"2024-10-16T16:26:16Z","snapshot_observed_at":"2026-08-05T08:03:00.174587Z","submitted_at":"2024-02-28T18:57:56Z","title":"Diffusion Language Models Are Versatile Protein Learners","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.18567","snapshot_observed_at":"2026-08-10T16:17:32.186092Z","title":"Diffusion language models are versatile protein learners","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.186092Z"},"links":{"cited_paper":"/paper/2402.18567","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:acdf1926aec82bb1ba64ae3db556ee342d3a01ff4cb04cdef347013c6f36dd6f","observation_id":"e77aa50b-9bb2-43ed-983e-4d4844559610","resolution":{"observed_at":"2026-08-10T16:17:32.186092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.13782","last_updated":"2024-10-17T17:20:24Z","snapshot_observed_at":"2026-08-06T04:16:22.665673Z","submitted_at":"2024-10-17T17:20:24Z","title":"DPLM-2: A Multimodal Diffusion Protein Language Model","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.13782","snapshot_observed_at":"2026-08-10T16:17:32.189714Z","title":"Dplm-2: A multimodal diffusion protein language model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.189714Z"},"links":{"cited_paper":"/paper/2410.13782","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:ec71da38632e71d66492fbe3f6b2eeca587871ed13e9845b0605b92119fdc29e","observation_id":"f51e3b28-f670-4e48-9d74-6221de8e84f2","resolution":{"observed_at":"2026-08-10T16:17:32.189714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.927018Z","title":null,"venue":null,"work_id":"9f7b8c5d-e296-4a5e-ad77-1d7c396120d7","year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.193615Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7e3567577d68fb415af399dd6f71b572762f3bf949d3b9d4a89ad6772fa93563","observation_id":"d3070679-8ea2-4f06-bae6-e72ab0660e71","resolution":{"observed_at":"2026-08-10T16:17:32.931501Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.197872Z","title":"Smiles, a chemical language and information system","venue":null,"work_id":null,"year":1988},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.197872Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:324e3e555f46470fb2544c5bf7706732537821c0caa0797af385179803de7bda","observation_id":"1d9e2201-28e9-4efe-9b7c-91f430ef2bd4","resolution":{"observed_at":"2026-08-10T16:17:32.197872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08005","last_updated":"2023-02-10T06:51:56Z","snapshot_observed_at":"2026-08-10T22:38:49.994764Z","submitted_at":"2022-02-16T11:42:34Z","title":"Should You Mask 15% in Masked Language Modeling?","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08005","snapshot_observed_at":"2026-08-10T16:17:32.202543Z","title":"Should you mask 15\\ arXiv preprint arXiv:2202.08005, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.202543Z"},"links":{"cited_paper":"/paper/2202.08005","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c4b49f8fd7654b870edcffe2c6a21626569e2a5abddd7736d7b01ac0c50756c5","observation_id":"ddf3eb95-642c-48bd-9360-f152978044f4","resolution":{"observed_at":"2026-08-10T16:17:32.202543Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.905408Z","title":"A broad-coverage challenge corpus for sentence understanding through inference","venue":null,"work_id":"47f63b97-dfa2-47c8-bfbb-4483d3d02019","year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.206385Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:58769d71204cba376b9d0d18061a138262d8e9850526a155f23b2164c0442a9d","observation_id":"09ec8fd4-9b01-4950-afdf-f7c15412ed5d","resolution":{"observed_at":"2026-08-10T16:17:32.909620Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.893290Z","title":"N., Gomes, J., Geniesse, C., Pappu, A","venue":null,"work_id":"62a5279f-91b5-4617-a415-667584cd0db4","year":2018},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.210287Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c4f6a976f9e5bb86866a8139587f5372b2aae82508006fb240d5e3b7d2f0bf09","observation_id":"57f2ce21-ac47-4c99-819a-a88f58a9a8dd","resolution":{"observed_at":"2026-08-10T16:17:32.897244Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.882134Z","title":null,"venue":null,"work_id":"d92d95e8-da42-4619-b307-b0e5adfc6776","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.213896Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:609ebad021b37d215bbe3c4ea4e14e9ea62470af38208be368753dc871623473","observation_id":"e30db846-021e-40cf-8230-fb9b951fe3ea","resolution":{"observed_at":"2026-08-10T16:17:32.885823Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.870555Z","title":"Simmim: A simple framework for masked image modeling","venue":null,"work_id":"d1f3fd2f-ff0d-4afc-9b6a-4eba096b80bb","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.217118Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:251dd7ba1bf4253a49dff29cfe6e476805aa34690cb9c9a3d0f041a82d23bebc","observation_id":"f3adb450-7c19-4028-b4a0-8d1ef39c4d90","resolution":{"observed_at":"2026-08-10T16:17:32.874260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.857772Z","title":"Pushing the boundaries of molecular representation for drug discovery with the graph attention mechanism","venue":null,"work_id":"57141364-e0bc-4047-8479-4fbb408ef61a","year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.220890Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:e902c23414ca36d2c81aac1a04d83d864d0e1089860d469cf62efa4bd8ca754a","observation_id":"1bfb2d07-f062-440f-98a1-1773c76ad54e","resolution":{"observed_at":"2026-08-10T16:17:32.862517Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.843755Z","title":"scbert as a large-scale pretrained deep language model for cell type annotation of single-cell rna-seq data","venue":null,"work_id":"bbec9b00-ade6-42b1-a5db-ebcdf8a948b1","year":2022},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.225237Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:5217823dac93e7e5081b42721879c2dcf3eb3bbc64fcd07165a693417bd94d4d","observation_id":"a73cb776-ed42-424e-8c1f-f70bfa0b4ff8","resolution":{"observed_at":"2026-08-10T16:17:32.849088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.825863Z","title":"Mol-ae: Auto-encoder based molecular representation learning with 3d cloze test objective","venue":null,"work_id":"628d116a-186a-499e-a304-60cfe92f0177","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.228968Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:3a9ac6bf4b6fc09585181cce707f1f0c19763534c139c9e437c5b62af70e14dc","observation_id":"57c9f3cf-c513-4839-94e4-b3045f52b18c","resolution":{"observed_at":"2026-08-10T16:17:32.833597Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.812470Z","title":"Analyzing learned molecular representations for property prediction","venue":null,"work_id":"982b85d8-0e38-426e-8df7-a229df0d3b93","year":2019},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.232966Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:dd8a1ca98b90a8cb5331a22a29d55392b9d2b9edf18ee1d1da65155c696cfa05","observation_id":"d65c921a-5d4d-499e-98d5-9fd795b5262c","resolution":{"observed_at":"2026-08-10T16:17:32.816442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.07421","last_updated":"2020-05-15T09:02:38Z","snapshot_observed_at":"2026-08-08T22:04:57.064213Z","submitted_at":"2020-05-15T09:02:38Z","title":"Spelling Error Correction with Soft-Masked BERT","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.07421","snapshot_observed_at":"2026-08-10T16:17:32.237061Z","title":"Spelling error correction with soft-masked bert","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.237061Z"},"links":{"cited_paper":"/paper/2005.07421","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:ea05e6a2d590f0268cfa9a97358c02c2f8850d508c0acaacd214515660b027b1","observation_id":"5b222e63-d880-45fb-8d68-8fb4b03b341b","resolution":{"observed_at":"2026-08-10T16:17:32.237061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.799951Z","title":"Towards a unified training for levenshtein transformer","venue":null,"work_id":"13841965-37bd-438c-a686-c7cc0c81e992","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.241370Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:e6db698d9b5a6fe876e89e65f4edff4fc0a528d724f2d33ea319daf3b7a13b74","observation_id":"53578d49-5eae-4770-977b-be0658ccbb96","resolution":{"observed_at":"2026-08-10T16:17:32.804123Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.05569","last_updated":"2025-06-08T14:14:26Z","snapshot_observed_at":"2026-07-06T20:03:11.541819Z","submitted_at":"2024-12-07T07:32:55Z","title":"SMI-Editor: Edit-based SMILES Language Model with Fragment-level Supervision","version":2},"cited_work":{"arxiv_id":"2412.05569","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.05569","snapshot_observed_at":"2026-08-10T16:17:32.360164Z","title":"SMI-Editor: Edit-based SMILES Language Model with Fragment-level Supervision","venue":"cs.LG","work_id":"ac3fb0d3-ccdf-4ecc-bec2-31633d5aef78","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.245386Z"},"links":{"cited_paper":"/paper/2412.05569","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:15c1dd491150ac1b793ce8ecb6c8b813ba13f76093e4d637ec46c3ead5e75309","observation_id":"a1a1894e-8875-4902-b2e6-66393a9de2c7","resolution":{"observed_at":"2026-08-10T16:17:32.364579Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.788190Z","title":"Esm all-atom: Multi-scale protein language model for unified molecular modeling","venue":null,"work_id":"5cd373f3-880b-4e31-903e-13caf3c072e1","year":2024},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.249241Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:26d62074731df124691c07be289466e7c3b8af7616e0c7b49a364ba66489caf7","observation_id":"85049962-b38d-4058-9adb-3afd86cd84dd","resolution":{"observed_at":"2026-08-10T16:17:32.792220Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.10198","last_updated":"2023-03-02T14:33:12Z","snapshot_observed_at":"2026-08-11T03:13:41.586299Z","submitted_at":"2023-02-19T12:29:33Z","title":"Can ChatGPT Understand Too? A Comparative Study on ChatGPT and Fine-tuned BERT","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.10198","snapshot_observed_at":"2026-08-10T16:17:32.252620Z","title":"Can chatgpt understand too? a comparative study on chatgpt and fine-tuned bert","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.252620Z"},"links":{"cited_paper":"/paper/2302.10198","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:78a8b57582cd842bedd7d93fd8ede4068348a39362fde05a6b286df2fe38c7e2","observation_id":"a861a9e3-8806-418b-853d-92b8a42ef65d","resolution":{"observed_at":"2026-08-10T16:17:32.252620Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.15273","last_updated":"2023-05-24T15:59:44Z","snapshot_observed_at":"2026-07-06T15:32:39.787935Z","submitted_at":"2023-05-24T15:59:44Z","title":"Revisiting Token Dropping Strategy in Efficient BERT Pretraining","version":1},"cited_work":{"arxiv_id":"2305.15273","doi":null,"metadata_source":"pith","pith_arxiv_id":"2305.15273","snapshot_observed_at":"2026-08-10T16:17:32.329439Z","title":"Revisiting Token Dropping Strategy in Efficient BERT Pretraining","venue":"cs.CL","work_id":"67fa7fa0-f566-4d39-9520-cb68a652f75c","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.256286Z"},"links":{"cited_paper":"/paper/2305.15273","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:8c60666fb7e1d8c5206862c52e0dc1d64050972969d09d5a113bbf24de51a184","observation_id":"29d68c9d-1b61-498d-a00e-39d5749a899b","resolution":{"observed_at":"2026-08-10T16:17:32.334782Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.774191Z","title":"Uni-mol: A universal 3d molecular representation learning framework","venue":null,"work_id":"a63d39ca-19ed-4cd7-8feb-d341080ef873","year":2023},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.260657Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:c03c9f996688dc2f67e01d82fa464f49326fe56ce89914dc1f9c232381f378e6","observation_id":"4b8e1b01-b072-44fb-802f-fa7f4d789c5d","resolution":{"observed_at":"2026-08-10T16:17:32.778561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-11T06:34:44.6726+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-10T16:17:32.264116Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.264116Z"},"links":{"citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:645833569267eb77f59cccb70824f6ccaf257926dd26c3c48f4dc18cc7e232ae","observation_id":"c58d9ab9-2ebb-41ad-b8ff-8fec8cd5ced2","resolution":{"observed_at":"2026-08-10T16:17:32.264116Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","latest_version":5,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":50,"verified_exact":9,"verified_fuzzy":31},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-11T06:34:44.6726+00:00","source":"crossref"},{"observed_at":"2026-08-11T06:34:36.301508+00:00","source":"retraction_watch"}],"thesis":"As of 11 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 1 inbound Pith citation observation for arXiv:2501.13397."}