{"as_of":"2026-08-13T01:10:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:3b7e1f6b0d1baaf1dd2532db59678a5f92acbfceaba03f470168669a5302dfbb","coverage":[{"denominator":44,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":44,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-13T04:50:53.587891Z","state":"measured"},{"denominator":144,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":144,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":188,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-12T16:26:24.656130Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":430,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2104.09864","last_updated":"2023-11-08T13:36:32Z","snapshot_observed_at":"2026-08-12T04:55:58.532015Z","submitted_at":"2021-04-20T09:54:06Z","title":"RoFormer: Enhanced Transformer with Rotary Position Embedding","version":5},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T19:37:06.610156Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2104.09864"},"observation_digest":"sha256:a48ddbcb24101ae0728c4a221c67210f2476ce0caa3f4eac351807b7a502031f","observation_id":"20bc2526-e3d9-455b-a0a1-015de03009b3","resolution":{"observed_at":"2026-05-13T04:50:53.733541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2112.04359","last_updated":"2021-12-08T16:09:48Z","snapshot_observed_at":"2026-08-09T15:17:43.394064Z","submitted_at":"2021-12-08T16:09:48Z","title":"Ethical and social risks of harm from Language Models","version":1},"reference_index":109,"source":"arxiv_source","source_observed_at":"2026-05-11T18:24:28.835688Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2112.04359"},"observation_digest":"sha256:dcaea4cb47651a4283830e174b556700e9a20ff3810734192001ada9ac71b976","observation_id":"23321776-4543-4ebd-80b2-6329f45e3600","resolution":{"observed_at":"2026-05-13T04:50:53.733541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2212.03827","last_updated":"2024-03-02T21:33:53Z","snapshot_observed_at":"2026-08-10T11:37:23.229129Z","submitted_at":"2022-12-07T18:17:56Z","title":"Discovering Latent Knowledge in Language Models Without Supervision","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-15T20:34:08.207848Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2212.03827"},"observation_digest":"sha256:f5e88307416bbfa571bd067a448c52e0fd227ac4346beb0d4fa5f079b9dfd9a0","observation_id":"560aaf69-397e-4a37-9c29-567103800a68","resolution":{"observed_at":"2026-05-15T20:34:08.302421Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-12T18:00:05.294144Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2302.09664"},"observation_digest":"sha256:4408e83ea5b6b0a92fa5c29b5bee46854507bfc8eb35bf04fbc5e12049ba7700","observation_id":"5627016a-0828-4ea5-a525-56daa0159154","resolution":{"observed_at":"2026-05-13T04:50:53.733541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2309.16671","last_updated":"2025-11-23T00:34:43Z","snapshot_observed_at":"2026-08-02T18:24:11.208164Z","submitted_at":"2023-09-28T17:59:56Z","title":"Demystifying CLIP Data","version":6},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-16T09:20:20.143143Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2309.16671"},"observation_digest":"sha256:f59d95309f524bcd5f9da03438232584610284a717c63440eee0b97c6bc12739","observation_id":"52a8ab12-6c72-4c01-8e41-d2ec33b1d583","resolution":{"observed_at":"2026-05-16T09:20:20.284721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2312.08935","last_updated":"2024-02-19T14:07:53Z","snapshot_observed_at":"2026-08-11T06:00:55.192366Z","submitted_at":"2023-12-14T13:41:54Z","title":"Math-Shepherd: Verify and Reinforce LLMs Step-by-step without Human Annotations","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-14T22:34:15.638114Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2312.08935"},"observation_digest":"sha256:d3553bd2e6a32f6dc9514077b5262a3941455f3d225c45a53dc6f0c57e5473da","observation_id":"ac720906-53ad-4ebc-bb52-77896cb5a414","resolution":{"observed_at":"2026-05-14T22:34:15.964204Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-11T15:22:54.023279Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2402.06196"},"observation_digest":"sha256:c82f0731a415a216f6d8129b0eba25e04f589ce25edd31547836b69341d51919","observation_id":"877a4f7b-a968-435c-b818-67356ba085f9","resolution":{"observed_at":"2026-05-13T04:50:53.733541Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T16:26:24.656130Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.13477","last_updated":"2024-11-20T17:23:40Z","snapshot_observed_at":"2026-08-12T16:20:06.440650Z","submitted_at":"2024-11-20T17:23:40Z","title":"PatentEdits: Framing Patent Novelty as Textual Entailment","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-12T16:26:24.656130Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.13477"},"observation_digest":"sha256:5ae33ec7f241ae1df3f9f142773437c6de5e72e577e4c31c185b21ba2b4d1b38","observation_id":"86605260-2fec-4f63-ad2b-83280f23c3db","resolution":{"observed_at":"2026-08-12T16:26:24.656130Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T15:01:18.948849Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2411.14739","last_updated":"2024-11-22T05:18:35Z","snapshot_observed_at":"2026-08-12T14:55:10.706816Z","submitted_at":"2024-11-22T05:18:35Z","title":"IRLab@iKAT24: Learned Sparse Retrieval with Multi-aspect LLM Query Generation for Conversational Search","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T15:01:18.948849Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.14739"},"observation_digest":"sha256:291f41f42e96817a01bd845fe2e02344bc712f38ea823bbf52e0e3e022579374","observation_id":"bf08b68d-a08d-4fcd-821c-8899c4de516b","resolution":{"observed_at":"2026-08-12T15:01:18.948849Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T14:24:50.774351Z","title":"arXiv:2006.03654 [cs]","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.15386","last_updated":"2024-11-23T00:01:07Z","snapshot_observed_at":"2026-08-12T14:19:27.432689Z","submitted_at":"2024-11-23T00:01:07Z","title":"Inducing Human-like Biases in Moral Reasoning Language Models","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-12T14:24:50.774351Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.15386"},"observation_digest":"sha256:8d588dfd32c418009fd1de69ee8618dfcbea6dd4e378ccacd51be9ae42578ea6","observation_id":"b332e8ba-7089-407a-b6ae-40369272eb23","resolution":{"observed_at":"2026-08-12T14:24:50.774351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T14:00:58.206761Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.15734","last_updated":"2025-08-19T11:00:49Z","snapshot_observed_at":"2026-08-12T13:55:50.151004Z","submitted_at":"2024-11-24T06:38:24Z","title":"Development of Pre-Trained Transformer-based Models for the Nepali Language","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-12T14:00:58.206761Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.15734"},"observation_digest":"sha256:c751507a5c11aa731895cb2206f2c9bc0a1b5cc28747f6b9c40bb9d91bcc27e4","observation_id":"41493034-0c3f-48ba-b3e1-46ce97aed0d3","resolution":{"observed_at":"2026-08-12T14:00:58.206761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T12:45:19.916845Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.16991","last_updated":"2024-11-25T23:37:48Z","snapshot_observed_at":"2026-08-13T00:42:53.806976Z","submitted_at":"2024-11-25T23:37:48Z","title":"Dynamic Self-Distillation via Previous Mini-batches for Fine-tuning Small Language Models","version":1},"reference_index":2016,"source":"pdf_text","source_observed_at":"2026-08-12T12:45:19.916845Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.16991"},"observation_digest":"sha256:f18825fea1a40b5d41b2b144a254c6d6b14387fd3ba1aa8511926bd2aa310bd7","observation_id":"09fe76da-f4e4-4059-8432-c263093fe682","resolution":{"observed_at":"2026-08-12T12:45:19.916845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T12:33:09.218193Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.17130","last_updated":"2025-03-26T13:09:32Z","snapshot_observed_at":"2026-08-12T12:26:44.808060Z","submitted_at":"2024-11-26T05:49:25Z","title":"TechCoach: Towards Technical-Point-Aware Descriptive Action Coaching","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-12T12:33:09.218193Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.17130"},"observation_digest":"sha256:5604df60618e5eb11cec379d288c195b45adee6e1320312505910c5c3f4076c5","observation_id":"d3d920ae-14c5-48c8-ba01-81a6b33d1b33","resolution":{"observed_at":"2026-08-12T12:33:09.218193Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T11:44:18.206138Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.17983","last_updated":"2024-11-27T01:40:50Z","snapshot_observed_at":"2026-08-12T18:53:05.403076Z","submitted_at":"2024-11-27T01:40:50Z","title":"Optimized Conformal Selection: Powerful Selective Inference After Conformity Score Optimization","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-12T11:44:18.206138Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.17983"},"observation_digest":"sha256:efce757a9556fb9c5c9d76d9795af359c85fb24ff64edfecd81fc2f55b699717","observation_id":"6fbfe664-e14f-422c-97d2-0d0731c15faf","resolution":{"observed_at":"2026-08-12T11:44:18.206138Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T11:38:41.994508Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2411.18021","last_updated":"2024-11-27T03:31:14Z","snapshot_observed_at":"2026-08-12T20:24:10.249610Z","submitted_at":"2024-11-27T03:31:14Z","title":"Can bidirectional encoder become the ultimate winner for downstream applications of foundation models?","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-12T11:38:41.994508Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2411.18021"},"observation_digest":"sha256:0a65746e72283ad8c2b84d5b8d13d2a448a358803045a8ff2a72a5ee610e8101","observation_id":"ac8ebfc7-4986-4c44-90b2-59b843681f39","resolution":{"observed_at":"2026-08-12T11:38:41.994508Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-12T05:36:06.833586Z","title":"Deberta: Decoding-enhanced bert with disentan- gled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.00324","last_updated":"2025-04-13T13:19:21Z","snapshot_observed_at":"2026-08-13T00:34:10.513685Z","submitted_at":"2024-11-30T02:45:01Z","title":"Table Integration in Data Lakes Unleashed: Pairwise Integrability Judgment, Integrable Set Discovery, and Multi-Tuple Conflict Resolution","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-12T05:36:06.833586Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.00324"},"observation_digest":"sha256:f7380a6901c0ad871899cf5f585f9906b4298811b1e5a0c81ee619045b7ba66c","observation_id":"3cb69815-17aa-473b-ab51-4a6db4b3b1f4","resolution":{"observed_at":"2026-08-12T05:36:06.833586Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T22:41:20.374748Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.03220","last_updated":"2024-12-04T11:14:06Z","snapshot_observed_at":"2026-08-12T02:41:01.162604Z","submitted_at":"2024-12-04T11:14:06Z","title":"Survey of different Large Language Model Architectures: Trends, Benchmarks, and Challenges","version":1},"reference_index":180,"source":"pdf_text","source_observed_at":"2026-08-11T22:41:20.374748Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.03220"},"observation_digest":"sha256:8804cca40cb81216cffc25b74e9933d73f505899a03a377e10aa8dc841663f31","observation_id":"bea8e1da-5d59-4bde-9afa-b8172220c311","resolution":{"observed_at":"2026-08-11T22:41:20.374748Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T22:40:34.849646Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.03275","last_updated":"2024-12-04T12:34:15Z","snapshot_observed_at":"2026-08-11T22:32:47.426720Z","submitted_at":"2024-12-04T12:34:15Z","title":"AntLM: Bridging Causal and Masked Language Models","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T22:40:34.849646Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.03275"},"observation_digest":"sha256:e8aee3c0262dc19c2422d251a6e9dcb7b281e0f6816d945649e48efe12642f25","observation_id":"b965496d-22ad-4352-889a-ebe36e518a34","resolution":{"observed_at":"2026-08-11T22:40:34.849646Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T20:37:54.760094Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.05563","last_updated":"2025-07-01T22:08:39Z","snapshot_observed_at":"2026-08-12T01:48:12.089703Z","submitted_at":"2024-12-07T06:56:01Z","title":"A Survey on Uncertainty Quantification of Large Language Models: Taxonomy, Open Research Challenges, and Future Directions","version":2},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-11T20:37:54.760094Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.05563"},"observation_digest":"sha256:d70091d5bfc9800ed9d9e5b57407ec9d048520a04209e3042c5a18a14b9c273f","observation_id":"7614f109-96b5-454d-bbd7-cda4759f2281","resolution":{"observed_at":"2026-08-11T20:37:54.760094Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T16:26:04.408714Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10095","last_updated":"2025-01-09T09:09:32Z","snapshot_observed_at":"2026-08-11T16:18:59.284753Z","submitted_at":"2024-12-13T12:31:06Z","title":"HiTZ at VarDial 2025 NorSID: Overcoming Data Scarcity with Language Transfer and Automatic Data Annotation","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T16:26:04.408714Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.10095"},"observation_digest":"sha256:fd0e66b4164cac2d04331e5ff7dbcb7d8c9c763babb58f2e18c3659f4185e559","observation_id":"3f0c1608-2516-4a16-b108-ce97c8a23667","resolution":{"observed_at":"2026-08-11T16:26:04.408714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T16:12:05.896859Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.10313","last_updated":"2024-12-13T17:53:29Z","snapshot_observed_at":"2026-08-11T20:38:27.858962Z","submitted_at":"2024-12-13T17:53:29Z","title":"MST-R: Multi-Stage Tuning for Retrieval Systems and Metric Evaluation","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T16:12:05.896859Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.10313"},"observation_digest":"sha256:5995eaf2de80f5fe2dbc24c374acb1967c1090b4e74e8f433489307ea9c5830d","observation_id":"f3d3366f-fdaf-4c5d-a12f-2d54b65d85f4","resolution":{"observed_at":"2026-08-11T16:12:05.896859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T15:06:30.684936Z","title":"Deberta: Decoding-enhanced bert with disentangled attention.arXiv preprint arXiv:2006.03654, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.11459","last_updated":"2025-07-08T13:14:01Z","snapshot_observed_at":"2026-08-12T03:11:45.782244Z","submitted_at":"2024-12-16T05:33:05Z","title":"Rethinking Associative Memory Mechanism in Induction Head","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:30.684936Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.11459"},"observation_digest":"sha256:f191f34639617772399be629844425f53112a83e79b2c75d8e5d759717df6c8b","observation_id":"3a3d3316-69ef-487d-834a-05c6638109a9","resolution":{"observed_at":"2026-08-11T15:06:30.684936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T13:36:07.035296Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2412.12954","last_updated":"2024-12-17T14:35:33Z","snapshot_observed_at":"2026-08-11T13:31:24.774074Z","submitted_at":"2024-12-17T14:35:33Z","title":"Recipient Profiling: Predicting Characteristics from Messages","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T13:36:07.035296Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.12954"},"observation_digest":"sha256:7badf549a74e1f72ab3b384b862fdc9623e0508bf5855a7e7fe4b019f5a35663","observation_id":"50e8d085-660b-4816-bde4-50c884203832","resolution":{"observed_at":"2026-08-11T13:36:07.035296Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T11:15:12.780136Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.15683","last_updated":"2024-12-20T09:02:26Z","snapshot_observed_at":"2026-08-12T02:27:42.554674Z","submitted_at":"2024-12-20T09:02:26Z","title":"Variability Need Not Imply Error: The Case of Adequate but Semantically Distinct Responses","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:15:12.780136Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.15683"},"observation_digest":"sha256:ce81f3543136149df1f6ae8a2f9326116a4d8c12fdfd9c3be2b02c8694be6b2a","observation_id":"cb67b73b-05de-4dde-9ac3-990931ce7b34","resolution":{"observed_at":"2026-08-11T11:15:12.780136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T20:23:12.728320Z","title":", author Liu, X","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2412.16174","last_updated":"2024-12-08T06:11:55Z","snapshot_observed_at":"2026-08-11T20:16:31.597508Z","submitted_at":"2024-12-08T06:11:55Z","title":"Experimenting with Multi-modal Information to Predict Success of Indian IPOs","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T20:23:12.728320Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.16174"},"observation_digest":"sha256:48404824d8e15ce27f5de1a0cf404a4d9ca4186f33257c73c39c2145f9b97787","observation_id":"9811f78e-a53e-4c97-9d76-e68986eb6f69","resolution":{"observed_at":"2026-08-11T20:23:12.728320Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-11T00:37:46.439437Z","title":"DeBERTa: Decoding-enhanced BERT with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2412.19449","last_updated":"2024-12-27T04:37:06Z","snapshot_observed_at":"2026-08-11T00:33:06.192072Z","submitted_at":"2024-12-27T04:37:06Z","title":"Feature Alignment-Based Knowledge Distillation for Efficient Compression of Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-11T00:37:46.439437Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2412.19449"},"observation_digest":"sha256:0bcd64a7f2a69a776a1749ad194fffb58d183e1042f95f617117f80f6cadaf06","observation_id":"f30954d7-76f7-4b00-b6e6-93c44ad89042","resolution":{"observed_at":"2026-08-11T00:37:46.439437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:48:53.503917Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.00759","last_updated":"2025-07-10T07:45:30Z","snapshot_observed_at":"2026-08-11T20:19:58.966053Z","submitted_at":"2025-01-01T07:05:32Z","title":"Enhancing Transformers for Generalizable First-Order Logical Entailment","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-10T22:48:53.503917Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.00759"},"observation_digest":"sha256:5291839cd797c572d280377d7dee0a80ae0e0636063c58bbe01a25cf7cfa6427","observation_id":"2e810c02-7b54-4daa-9536-b5995912cbed","resolution":{"observed_at":"2026-08-10T22:48:53.503917Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:28:06.859112Z","title":"Deberta: Decoding-enhanced bert with disentan- gled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.01625","last_updated":"2025-01-03T03:46:51Z","snapshot_observed_at":"2026-08-12T02:24:50.215653Z","submitted_at":"2025-01-03T03:46:51Z","title":"ICPC: In-context Prompt Compression with Faster Inference","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-10T22:28:06.859112Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.01625"},"observation_digest":"sha256:a3e1d7a2260053183f1807270341065cb8b759965adb73d6ff520e9dd48c5a2f","observation_id":"a3ea3ef7-0bd9-4d39-929d-16274402daa6","resolution":{"observed_at":"2026-08-10T22:28:06.859112Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:17:27.615379Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.02235","last_updated":"2025-03-10T03:41:41Z","snapshot_observed_at":"2026-08-11T12:44:48.413598Z","submitted_at":"2025-01-04T08:45:24Z","title":"Survey on Question Answering over Visually Rich Documents: Methods, Challenges, and Trends","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-10T22:17:27.615379Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.02235"},"observation_digest":"sha256:c635129989ec971c12ef49d2a52c2c694044bc38a45af1fb7bbd171e3207f276","observation_id":"67d31d31-fe16-4d7f-9b15-afaae4507a37","resolution":{"observed_at":"2026-08-10T22:17:27.615379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:12:49.165370Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.02654","last_updated":"2025-01-08T14:53:41Z","snapshot_observed_at":"2026-08-11T19:00:58.907199Z","submitted_at":"2025-01-05T20:39:52Z","title":"Tougher Text, Smarter Models: Raising the Bar for Adversarial Defence Benchmarks","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-10T22:12:49.165370Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.02654"},"observation_digest":"sha256:af2ad82f9e8cd486a0cd8ea8c4e46f5c87d544b5a9c7193b819b6c97b1b6edfb","observation_id":"1add7c90-be24-41f8-b322-dfa2a147ae12","resolution":{"observed_at":"2026-08-10T22:12:49.165370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T22:01:44.053505Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.03064","last_updated":"2025-01-06T15:02:30Z","snapshot_observed_at":"2026-08-11T17:10:54.040592Z","submitted_at":"2025-01-06T15:02:30Z","title":"Trust Modeling in Counseling Conversations: A Benchmark Study","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-10T22:01:44.053505Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.03064"},"observation_digest":"sha256:fd5b34d8b51cfd898820c554842e86117f4a096d1dd5b6283d2b270909475bc4","observation_id":"09d67d12-f0bd-41af-a3f0-3e10cd68d22e","resolution":{"observed_at":"2026-08-10T22:01:44.053505Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T21:46:29.313119Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.03939","last_updated":"2025-01-11T14:21:37Z","snapshot_observed_at":"2026-08-11T03:31:24.809067Z","submitted_at":"2025-01-07T17:00:35Z","title":"Visual question answering: from early developments to recent advances -- a survey","version":2},"reference_index":265,"source":"arxiv_source","source_observed_at":"2026-08-10T21:46:29.313119Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.03939"},"observation_digest":"sha256:a1065d99ac374ddfe9c7da1368c2e0e260f71f8155b803b2c5ca4f80867980a9","observation_id":"84809db1-cf20-4191-ad4c-bddec741d540","resolution":{"observed_at":"2026-08-10T21:46:29.313119Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T21:26:47.147465Z","title":"and Chen, W., 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.04880","last_updated":"2025-01-08T23:28:28Z","snapshot_observed_at":"2026-08-12T17:15:27.113839Z","submitted_at":"2025-01-08T23:28:28Z","title":"Leveraging Log Probabilities in Language Models to Forecast Future Events","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-10T21:26:47.147465Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.04880"},"observation_digest":"sha256:e67b4b8bb06459ef38faad340ea89f0dc4b2cf36ab451e7ed88bf844fa307966","observation_id":"bb365a76-d792-4d1b-9d1a-1879910ed3d5","resolution":{"observed_at":"2026-08-10T21:26:47.147465Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T21:23:56.481579Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05018","last_updated":"2025-01-09T07:21:44Z","snapshot_observed_at":"2026-08-11T15:38:21.225923Z","submitted_at":"2025-01-09T07:21:44Z","title":"Finding Needles in Emb(a)dding Haystacks: Legal Document Retrieval via Bagging and SVR Ensembles","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-10T21:23:56.481579Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.05018"},"observation_digest":"sha256:26bd07baee9f849b75dc617fd260ff7ccebf5d8691d2e9257297514a67899dad","observation_id":"7abb53dc-9ca5-4a61-98b1-81813f6b9707","resolution":{"observed_at":"2026-08-10T21:23:56.481579Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T21:15:23.272106Z","title":"A., Badawy, A., Ramadan, D","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.05443","last_updated":"2025-01-09T18:55:50Z","snapshot_observed_at":"2026-08-12T02:47:34.738224Z","submitted_at":"2025-01-09T18:55:50Z","title":"A survey of textual cyber abuse detection using cutting-edge language models and large language models","version":1},"reference_index":5004,"source":"pdf_text","source_observed_at":"2026-08-10T21:15:23.272106Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.05443"},"observation_digest":"sha256:e642d33c5d749a91ab2ef774b7cf625a696b445d91a1678565f6d2a0e336d5e0","observation_id":"016b116f-5674-4133-92f0-c5e366eafaee","resolution":{"observed_at":"2026-08-10T21:15:23.272106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T21:09:42.370172Z","title":"Pengcheng He, Xiaodong Liu, Jianfeng Gao, and Weizhu Chen","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.06101","last_updated":"2025-02-18T22:02:42Z","snapshot_observed_at":"2026-08-12T10:58:04.022553Z","submitted_at":"2025-01-10T16:54:20Z","title":"From Conversation to Automation: Leveraging LLMs for Problem-Solving Therapy Analysis","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-10T21:09:42.370172Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.06101"},"observation_digest":"sha256:785543df0c1b3ea7fe17afe6d769349e41de86ec4d21c3690d9fa3b72f908556","observation_id":"2dd2c197-1f98-4ef7-a6c1-3c43f9012ea8","resolution":{"observed_at":"2026-08-10T21:09:42.370172Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2501.08313","last_updated":"2025-01-14T18:50:05Z","snapshot_observed_at":"2026-07-06T20:21:04.675084Z","submitted_at":"2025-01-14T18:50:05Z","title":"MiniMax-01: Scaling Foundation Models with Lightning Attention","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-16T06:26:38.569394Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.08313"},"observation_digest":"sha256:651a888a46c1799806f2b05348bd8242b5efdf68a70829937d3d34a56e57b5ad","observation_id":"be888aa7-5ee0-4438-83c4-eda59be1c32d","resolution":{"observed_at":"2026-05-16T06:26:38.683079Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T19:42:22.758873Z","title":"DeBERTa : Decoding -enhanced BERT with Disentangled Attention , October 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.09804","last_updated":"2025-01-16T19:23:11Z","snapshot_observed_at":"2026-08-10T20:21:04.164761Z","submitted_at":"2025-01-16T19:23:11Z","title":"Enhancing Generalization in Chain of Thought Reasoning for Smaller Models","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-10T19:42:22.758873Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.09804"},"observation_digest":"sha256:e347d03407b60ea2e678ffd9fa1410f6ba8c82bc5cbf9da01694ba2b6a54b9f4","observation_id":"4224cc27-d37b-410c-a95b-853b1281c33a","resolution":{"observed_at":"2026-08-10T19:42:22.758873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T18:53:21.171635Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.10967","last_updated":"2025-02-12T08:10:06Z","snapshot_observed_at":"2026-08-10T18:44:08.299248Z","submitted_at":"2025-01-19T07:00:46Z","title":"Advancing General Multimodal Capability of Vision-language Models with Pyramid-descent Visual Position Encoding","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-10T18:53:21.171635Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.10967"},"observation_digest":"sha256:8570e1a829b3dee0848f6b1bd00340feb02003fd71f49a64d69dc3c0f0888adb","observation_id":"6e2de7f6-551f-4427-b9d0-d7f619aad12f","resolution":{"observed_at":"2026-08-10T18:53:21.171635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T16:24:02.211511Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.13247","last_updated":"2025-01-22T21:58:04Z","snapshot_observed_at":"2026-08-12T14:32:18.281541Z","submitted_at":"2025-01-22T21:58:04Z","title":"Multimodal AI on Wound Images and Clinical Notes for Home Patient Referral","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-10T16:24:02.211511Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.13247"},"observation_digest":"sha256:13962b2f0cd9b01429cc729ed61b6764d65989e96411f810c5647d528c6ed555","observation_id":"47afe64d-2ec5-4ea4-9262-dd0a00aa24dc","resolution":{"observed_at":"2026-08-10T16:24:02.211511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T16:17:32.004551Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2501.13397","last_updated":"2025-06-08T14:16:13Z","snapshot_observed_at":"2026-08-10T22:41:14.141884Z","submitted_at":"2025-01-23T05:46:50Z","title":"ExLM: Rethinking the Impact of [MASK] Tokens in Masked Language Models","version":5},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-10T16:17:32.004551Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.13397"},"observation_digest":"sha256:7f59a0005f2517f65ded8bc6ac0d19ffb47552c0e8b953d0b49e6ba29523abef","observation_id":"f52e1a4f-8b4c-45db-8cbd-8307c47d792e","resolution":{"observed_at":"2026-08-10T16:17:32.004551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T14:28:46.583625Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.15321","last_updated":"2025-01-25T20:36:21Z","snapshot_observed_at":"2026-08-11T17:11:08.786764Z","submitted_at":"2025-01-25T20:36:21Z","title":"Figurative-cum-Commonsense Knowledge Infusion for Multimodal Mental Health Meme Classification","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-10T14:28:46.583625Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.15321"},"observation_digest":"sha256:24dd5e6836a29a138e6eaa9b7d7be3a5fe5bfe754320e904d5c92c95dd273adf","observation_id":"5da81942-4ec2-4746-a9d7-5015c67cc792","resolution":{"observed_at":"2026-08-10T14:28:46.583625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T14:25:18.664189Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.15374","last_updated":"2025-01-26T03:08:34Z","snapshot_observed_at":"2026-08-11T20:00:25.526993Z","submitted_at":"2025-01-26T03:08:34Z","title":"Evaluating the Effectiveness of XAI Techniques for Encoder-Based Language Models","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-10T14:25:18.664189Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.15374"},"observation_digest":"sha256:ca5bfc35030ce7439f5c381b3a64c20ab65af07a7a91dedab307681e55f54f93","observation_id":"9c1f6abd-a84d-4fff-9964-94f34418b83a","resolution":{"observed_at":"2026-08-10T14:25:18.664189Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-10T04:47:26.965131Z","title":"arXiv preprint arXiv:2006.03654 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2501.17449","last_updated":"2025-01-29T07:13:27Z","snapshot_observed_at":"2026-08-10T19:44:16.166682Z","submitted_at":"2025-01-29T07:13:27Z","title":"Cross-Language Approach for Quranic QA","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-10T04:47:26.965131Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2501.17449"},"observation_digest":"sha256:0fa6d4b3b87de8235d5ca8dc7b36450805ef850ae6706ddd0d42ae37e308c1be","observation_id":"45e1cd72-ad08-46d7-ad6d-bdf5ce826827","resolution":{"observed_at":"2026-08-10T04:47:26.965131Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-09T17:07:30.650448Z","title":"In Proceedings of the 2023 Con- ference on Empirical Methods in Natural Language Processing, pages 6465–6488, Singapore","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2502.00977","last_updated":"2025-08-08T05:23:01Z","snapshot_observed_at":"2026-08-10T20:44:28.182255Z","submitted_at":"2025-02-03T01:14:31Z","title":"Context-Aware Hierarchical Merging for Long Document Summarization","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-09T17:07:30.650448Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.00977"},"observation_digest":"sha256:9d4025927e62906e2bf01010162745d8b421430f0d0c2d6745dcaae2bd30d5bb","observation_id":"1f61227d-51f4-4436-b1c1-ec984a0c94e8","resolution":{"observed_at":"2026-08-09T17:07:30.650448Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"reference_index":157,"source":"arxiv_source","source_observed_at":"2026-05-17T02:11:36.932541Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.03387"},"observation_digest":"sha256:0d62e42e6a686bf20e43253b86276846d75fc6bb84c687e0e159f75f58015903","observation_id":"fa2675b9-2c3d-44bb-a6bd-fe8ea389cf22","resolution":{"observed_at":"2026-05-17T02:11:37.297679Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-09T05:52:54.512521Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.04372","last_updated":"2025-02-05T12:59:15Z","snapshot_observed_at":"2026-08-09T05:45:04.130124Z","submitted_at":"2025-02-05T12:59:15Z","title":"Mining Unstructured Medical Texts With Conformal Active Learning","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-09T05:52:54.512521Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.04372"},"observation_digest":"sha256:b0fa6339e3ace153446745c38d1700b00de92db75e2b4c2e95ca73c22c4694e3","observation_id":"2159e95e-5c44-4528-9858-6a36149c963f","resolution":{"observed_at":"2026-08-09T05:52:54.512521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T20:54:10.546588Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.04958","last_updated":"2025-02-07T14:22:35Z","snapshot_observed_at":"2026-08-09T00:26:10.962856Z","submitted_at":"2025-02-07T14:22:35Z","title":"SSMLoRA: Enhancing Low-Rank Adaptation with State Space Model","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-08T20:54:10.546588Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.04958"},"observation_digest":"sha256:659692d8c800a05de94c21109ccbe73f0d24e26fd8b41679cd1c57d072a7ef1d","observation_id":"12f6c73a-93b7-4b6f-84a9-50152ed69620","resolution":{"observed_at":"2026-08-08T20:54:10.546588Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T20:12:09.115223Z","title":"a rude, disrespectful, or unreasonable comment that is likely to make you leave a discussion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2502.05255","last_updated":"2026-06-10T17:49:41Z","snapshot_observed_at":"2026-08-12T09:20:21.631646Z","submitted_at":"2025-02-07T18:08:50Z","title":"Incivility in Public Health Policy Discussions Spills Over to Public Engagement with Climate Issues","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-08T20:12:09.115223Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.05255"},"observation_digest":"sha256:adcfbdc8f34a0d0f889fbdc220d96baa08064332a561bab26e4fec6e1114f6cb","observation_id":"34c57d5c-3995-46f8-8042-4e02311df080","resolution":{"observed_at":"2026-08-08T20:12:09.115223Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T19:53:30.105209Z","title":"Deberta: Decoding-enhanced bert with disentan- gled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.05312","last_updated":"2025-02-07T20:28:37Z","snapshot_observed_at":"2026-08-12T20:19:51.903535Z","submitted_at":"2025-02-07T20:28:37Z","title":"Towards the Development of Balanced Synthetic Data for Correcting Grammatical Errors in Arabic: An Approach Based on Error Tagging Model and Synthetic Data Generating Model","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-08T19:53:30.105209Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.05312"},"observation_digest":"sha256:bf5cd85c4d9d83f641291da10e2d4c3fe61c279006683e8e150874791714fc33","observation_id":"995a9ae2-2e2d-4f5b-8816-ed93d8dde357","resolution":{"observed_at":"2026-08-08T19:53:30.105209Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T16:57:27.774979Z","title":"Deberta: Decoding-enhanced bert with disentangled attention, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.06079","last_updated":"2025-09-01T20:58:35Z","snapshot_observed_at":"2026-08-12T08:17:52.685415Z","submitted_at":"2025-02-10T00:27:54Z","title":"Debiasing Guidance for Discrete Diffusion with Sequential Monte Carlo","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-08T16:57:27.774979Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.06079"},"observation_digest":"sha256:567fe54c6112e918455632495c0d8180673c3b264225d24e6421191b7217313c","observation_id":"097bb78b-0d1f-4ea3-a70f-0b4bf87bb687","resolution":{"observed_at":"2026-08-08T16:57:27.774979Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T18:43:34.317097Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.06881","last_updated":"2025-02-08T14:59:06Z","snapshot_observed_at":"2026-08-12T22:44:04.348189Z","submitted_at":"2025-02-08T14:59:06Z","title":"A Comprehensive Review of Protein Language Models","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-08T18:43:34.317097Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.06881"},"observation_digest":"sha256:48ea7ac97147bd77a025547107e072cb6a315460edc217f7962814f17e5de88e","observation_id":"1d948662-9eb2-4e4e-9610-846b9efda4f0","resolution":{"observed_at":"2026-08-08T18:43:34.317097Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T13:54:57.954405Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2502.07101","last_updated":"2025-02-10T22:46:57Z","snapshot_observed_at":"2026-08-12T09:20:07.934952Z","submitted_at":"2025-02-10T22:46:57Z","title":"SMAB: MAB based word Sensitivity Estimation Framework and its Applications in Adversarial Text Generation","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-08T13:54:57.954405Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.07101"},"observation_digest":"sha256:e7bd7a606e81383023c684e7ff78c1658d0581b7aeb006af85f805dc3aa68f51","observation_id":"0295b3b2-cc79-4b6b-83ed-1a4b6384f390","resolution":{"observed_at":"2026-08-08T13:54:57.954405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T11:17:19.724213Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2502.07982","last_updated":"2025-02-11T21:55:46Z","snapshot_observed_at":"2026-08-10T10:18:58.078783Z","submitted_at":"2025-02-11T21:55:46Z","title":"Deep Semantic Graph Learning via LLM based Node Enhancement","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-08T11:17:19.724213Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.07982"},"observation_digest":"sha256:25392e95b52536523649d574b06c15f94bdbea9e8f81d2a19df0d63be5a4117c","observation_id":"d29cb1b6-fc41-4b8a-a96d-d893d38958dc","resolution":{"observed_at":"2026-08-08T11:17:19.724213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-08T05:48:15.372324Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2502.08281","last_updated":"2025-02-12T10:38:22Z","snapshot_observed_at":"2026-08-10T17:19:38.110819Z","submitted_at":"2025-02-12T10:38:22Z","title":"Redefining Simplicity: Benchmarking Large Language Models from Lexical to Document Simplification","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-08T05:48:15.372324Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.08281"},"observation_digest":"sha256:7866e7b6776e534221dc28b05d9dfa184eaff586d2796349cc1c413b7143467a","observation_id":"23e5f5b2-b7b6-498e-82e1-d0127aea2f59","resolution":{"observed_at":"2026-08-08T05:48:15.372324Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2502.14912","last_updated":"2026-04-29T03:15:19Z","snapshot_observed_at":"2026-07-06T20:40:01.776087Z","submitted_at":"2025-02-19T07:26:03Z","title":"Semantic Embeddings of Chemical Elements for Enhanced Materials Inference and Discovery","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-23T02:34:58.555878Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2502.14912"},"observation_digest":"sha256:81c149f456b2d69463585caa2396c6ff3b2750a748aeca805142d6c07a03b710","observation_id":"86bc0f5e-30ae-41af-a970-28c37e7ca55f","resolution":{"observed_at":"2026-05-23T02:35:19.208621Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2503.22693","last_updated":"2026-05-20T06:35:51Z","snapshot_observed_at":"2026-08-02T19:43:11.453664Z","submitted_at":"2025-03-14T01:35:20Z","title":"Bridging Language Models and Financial Analysis","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-23T01:08:58.528533Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2503.22693"},"observation_digest":"sha256:03aa732e6a981e842cb3123b4cb8dbe017999e9ff1cdda46abb8c42b0782742c","observation_id":"6abbe7c7-d9c1-4acd-bb32-5c7e70d0b06d","resolution":{"observed_at":"2026-05-23T01:12:21.017772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2504.02343","last_updated":"2026-05-11T09:16:48Z","snapshot_observed_at":"2026-08-02T20:27:51.058597Z","submitted_at":"2025-04-03T07:24:18Z","title":"Toward General and Robust LLM-enhanced Text-attributed Graph Learning","version":2},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-22T21:26:35.707533Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2504.02343"},"observation_digest":"sha256:cce0aacaba93a6f1297c1e4042f39afebda380c3a8541ffe3e9b2030485fc2b2","observation_id":"d4509bac-2717-40b0-b1bc-fa19935bfc1c","resolution":{"observed_at":"2026-05-22T21:27:08.288135Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2505.11737","last_updated":"2026-04-11T18:08:02Z","snapshot_observed_at":"2026-08-02T07:06:47.956538Z","submitted_at":"2025-05-16T22:47:32Z","title":"TokUR: Token-Level Uncertainty Estimation for Large Language Model Reasoning","version":4},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-22T13:58:07.913104Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.11737"},"observation_digest":"sha256:5a4ea6063deb19baff955a2c738b8510abc8f0f65a923cdfcef28e8d97ee2f7a","observation_id":"939a6910-bfb6-4513-9e36-58088ba7baba","resolution":{"observed_at":"2026-05-22T14:01:38.233567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T15:23:33.742269Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.15507","last_updated":"2025-05-21T13:27:14Z","snapshot_observed_at":"2026-08-10T06:20:06.069417Z","submitted_at":"2025-05-21T13:27:14Z","title":"Directional Non-Commutative Monoidal Structures for Compositional Embeddings in Machine Learning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T15:23:33.742269Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.15507"},"observation_digest":"sha256:13cebbb7fa5c7fe48e0977f50abc6dd724d3199acce011accf1d9f4d3c336688","observation_id":"14e2d092-5ddd-48b9-86b6-7ee05dc72463","resolution":{"observed_at":"2026-08-07T15:23:33.742269Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T15:09:42.940547Z","title":"Deberta: Decoding- enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.16225","last_updated":"2025-05-26T01:51:47Z","snapshot_observed_at":"2026-08-09T10:53:21.539468Z","submitted_at":"2025-05-22T04:54:27Z","title":"MAPLE: Many-Shot Adaptive Pseudo-Labeling for In-Context Learning","version":2},"reference_index":2017,"source":"pdf_text","source_observed_at":"2026-08-07T15:09:42.940547Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.16225"},"observation_digest":"sha256:40dc9ef1b238b8d42a6bc3c5f2806fcbaec37c1e62a0109f928a7edfb0dcc912","observation_id":"d09607da-e044-4ab4-9269-beea4dbcb0ec","resolution":{"observed_at":"2026-08-07T15:09:42.940547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T15:03:50.529765Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.16502","last_updated":"2025-05-24T04:40:44Z","snapshot_observed_at":"2026-08-10T20:13:18.649864Z","submitted_at":"2025-05-22T10:36:05Z","title":"Recursive Offloading for LLM Serving in Multi-tier Networks","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T15:03:50.529765Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.16502"},"observation_digest":"sha256:14bb36d82664946747f02fa49a48d4fc7d4fb94e7624e59ec4ff598cb94d2a28","observation_id":"d1c3d795-ab01-44e4-89d7-028df13f9543","resolution":{"observed_at":"2026-08-07T15:03:50.529765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T14:36:10.053958Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.18333","last_updated":"2025-05-23T19:39:56Z","snapshot_observed_at":"2026-08-07T14:30:46.734293Z","submitted_at":"2025-05-23T19:39:56Z","title":"A Critical Evaluation of Defenses against Prompt Injection Attacks","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T14:36:10.053958Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.18333"},"observation_digest":"sha256:72435a685b6b4862fbfd7f92a391054a02454586cc54e2497ace6ea6a26af9f2","observation_id":"e8aaf2c4-ea62-4bba-ac53-c2e8394940c8","resolution":{"observed_at":"2026-08-07T14:36:10.053958Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T13:33:55.005545Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.21465","last_updated":"2025-05-27T17:36:23Z","snapshot_observed_at":"2026-08-07T16:43:25.522882Z","submitted_at":"2025-05-27T17:36:23Z","title":"ID-Align: RoPE-Conscious Position Remapping for Dynamic High-Resolution Adaptation in Vision-Language Models","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-07T13:33:55.005545Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.21465"},"observation_digest":"sha256:2681413213c88c7500695aaa87240e0ec8ff30c9e224b862ec57ad9c9d25a2bc","observation_id":"b8834c94-9199-485b-9a0a-00b0b974100f","resolution":{"observed_at":"2026-08-07T13:33:55.005545Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T13:23:44.299844Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.21973","last_updated":"2025-05-28T04:50:58Z","snapshot_observed_at":"2026-08-09T02:29:30.226783Z","submitted_at":"2025-05-28T04:50:58Z","title":"Towards Structure-aware Model for Multi-modal Knowledge Graph Completion","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T13:23:44.299844Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.21973"},"observation_digest":"sha256:e757a80efd1eea2b9e757cf8d4f6a03e90d655c427ee49bfc6b9fa6a9ddfec59","observation_id":"db5cd67f-ed07-40c2-88d6-2eab4292569a","resolution":{"observed_at":"2026-08-07T13:23:44.299844Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T13:04:14.575387Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.22771","last_updated":"2025-09-02T14:02:42Z","snapshot_observed_at":"2026-08-09T13:47:43.960918Z","submitted_at":"2025-05-28T18:39:56Z","title":"Automated Essay Scoring Incorporating Annotations from Automated Feedback Systems","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-07T13:04:14.575387Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.22771"},"observation_digest":"sha256:eda7f61913b217fd5127a1e42aaa54925c4a4217a7167a9f7f3b87c972eea577","observation_id":"3c00f4c8-5cac-4c6a-ae10-78d10904385b","resolution":{"observed_at":"2026-08-07T13:04:14.575387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T13:04:16.419765Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.22904","last_updated":"2025-05-30T16:21:57Z","snapshot_observed_at":"2026-08-09T21:41:41.535734Z","submitted_at":"2025-05-28T22:10:16Z","title":"Defining Foundation Models for Computational Science: A Call for Clarity and Rigor","version":2},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T13:04:16.419765Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.22904"},"observation_digest":"sha256:79738e2d04d347a1d5777e50944f65dbdfcb483b4c0629cc5ecad426c3c01494","observation_id":"03ab83e5-d6f4-46ed-ba01-f4f5dcaf8214","resolution":{"observed_at":"2026-08-07T13:04:16.419765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T12:59:24.519504Z","title":"Deberta: Decoding-enhanced bert with disentangled attention.arXiv preprint arXiv:2006.03654, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2505.23018","last_updated":"2025-06-25T09:38:19Z","snapshot_observed_at":"2026-08-12T23:29:49.286231Z","submitted_at":"2025-05-29T02:56:08Z","title":"EmotionTalk: An Interactive Chinese Multimodal Emotion Dataset With Rich Annotations","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:59:24.519504Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.23018"},"observation_digest":"sha256:1d3ae422916b5ccbb5e6c564247d55ba6e4509009a89149b39eeac6fa332e419","observation_id":"1300556b-741f-4e25-925b-95d797f93064","resolution":{"observed_at":"2026-08-07T12:59:24.519504Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T12:47:01.632603Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.23538","last_updated":"2025-05-29T15:19:00Z","snapshot_observed_at":"2026-08-10T19:26:34.214014Z","submitted_at":"2025-05-29T15:19:00Z","title":"CLaC at SemEval-2025 Task 6: A Multi-Architecture Approach for Corporate Environmental Promise Verification","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-07T12:47:01.632603Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.23538"},"observation_digest":"sha256:225fcef940a3dd7967cd88f056238726d48af1b9a034a5d05eb08746bc1656fc","observation_id":"97b80e08-d2b2-432b-a705-236b80236ea7","resolution":{"observed_at":"2026-08-07T12:47:01.632603Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T13:59:15.397940Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.23803","last_updated":"2026-05-23T02:25:19Z","snapshot_observed_at":"2026-08-12T02:26:27.220107Z","submitted_at":"2025-05-26T23:27:15Z","title":"MultiPhishGuard: An Explainable and Adaptive Multi-Agent LLM System for Phishing Email Detection","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:15.397940Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.23803"},"observation_digest":"sha256:123e6ff261aa755d26cf4c8dac16408120848c09a801dc5bf44332ba50047ae5","observation_id":"907025fd-d254-49e8-85a4-844273ccbdb8","resolution":{"observed_at":"2026-08-07T13:59:15.397940Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T12:28:25.517720Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2505.24533","last_updated":"2025-05-30T12:40:01Z","snapshot_observed_at":"2026-08-12T11:02:15.976377Z","submitted_at":"2025-05-30T12:40:01Z","title":"Directional Non-Commutative Monoidal Structures with Interchange Law via Commutative Generators","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:28:25.517720Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2505.24533"},"observation_digest":"sha256:88fd156ec670480ae1a70a9cb75b7a16a726fc8cc4af48a8f0cdd4e160e3f41b","observation_id":"447ff191-ed4b-4614-93fa-1342e5f7ca96","resolution":{"observed_at":"2026-08-07T12:28:25.517720Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T12:14:01.502501Z","title":"Amr Hendy, Mohamed Abdelrehim, Amr Sharaf, Vikas Raunak, Mohamed Gabr, Hitokazu Matsushita, Young Jin Kim, Mohamed Afify, and Hany Hassan Awadalla","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.00245","last_updated":"2025-05-30T21:21:05Z","snapshot_observed_at":"2026-08-09T10:32:18.940126Z","submitted_at":"2025-05-30T21:21:05Z","title":"Beyond Semantic Entropy: Boosting LLM Uncertainty Quantification with Pairwise Semantic Similarity","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T12:14:01.502501Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.00245"},"observation_digest":"sha256:e83da512e0a79119f00d96c648c8644f1170ba198545a75000e4142c3df6f706","observation_id":"664072d4-b6a8-4cd1-a6d5-9c72d0645ea2","resolution":{"observed_at":"2026-08-07T12:14:01.502501Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T12:12:28.852364Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.00344","last_updated":"2025-05-31T02:08:32Z","snapshot_observed_at":"2026-08-08T20:04:47.808291Z","submitted_at":"2025-05-31T02:08:32Z","title":"Efficient Latent Semantic Clustering for Scaling Test-Time Computation of LLMs","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-07T12:12:28.852364Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.00344"},"observation_digest":"sha256:832b1208d6e11385e048f80a17066c1ceed30a7d408ee1ce2642433cd7b17fa3","observation_id":"42fa8336-9e3d-4d00-8d3a-754547e88cb6","resolution":{"observed_at":"2026-08-07T12:12:28.852364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T06:01:40.133714Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.06238","last_updated":"2025-06-06T16:58:12Z","snapshot_observed_at":"2026-08-11T17:17:44.251425Z","submitted_at":"2025-06-06T16:58:12Z","title":"Explaining Matters: Leveraging Definitions and Semantic Expansion for Sexism Detection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-07T06:01:40.133714Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.06238"},"observation_digest":"sha256:b22552e28ef9aaf73b4079a6929f8d2d85f93056bffc578e24c078390843709c","observation_id":"a16845a0-ea56-4abc-96be-2f08a9f78a81","resolution":{"observed_at":"2026-08-07T06:01:40.133714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T05:33:48.367840Z","title":"Deberta: Decoding-enhanced bert with disentangled attention.arXiv preprint arXiv:2006.03654, 2020","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.07728","last_updated":"2025-06-09T13:11:35Z","snapshot_observed_at":"2026-08-07T05:24:43.093602Z","submitted_at":"2025-06-09T13:11:35Z","title":"\"I wasn't sure if this is indeed a security risk\": Data-driven Understanding of Security Issue Reporting in GitHub Repositories of Open Source npm Packages","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:33:48.367840Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.07728"},"observation_digest":"sha256:0f70ca2dbfa977abbee61227bf044cf890e678f816e455c7df587db404071e80","observation_id":"878cfebf-5f4a-420c-972f-1578cfde4f34","resolution":{"observed_at":"2026-08-07T05:33:48.367840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T05:08:30.382213Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.08774","last_updated":"2026-06-28T14:38:32Z","snapshot_observed_at":"2026-08-09T15:02:40.844890Z","submitted_at":"2025-06-10T13:16:26Z","title":"Multimodal Representation Alignment for Cross-modal Information Retrieval","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:08:30.382213Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.08774"},"observation_digest":"sha256:b41c88beeb263b64d5e367b6f1b21b0413459d28c291648494d5a8c1b8c52478","observation_id":"ea0e7c52-e9cc-4e03-9635-19dc93f6bebd","resolution":{"observed_at":"2026-08-07T05:08:30.382213Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T05:03:05.886203Z","title":"DeBERTa: Decoding-enhanced BERT with Disen- tangled Attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.08897","last_updated":"2025-08-19T13:22:49Z","snapshot_observed_at":"2026-08-10T01:38:25.006894Z","submitted_at":"2025-06-10T15:24:03Z","title":"PlantDeBERTa: An Open Source Language Model for Plant Science","version":4},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:03:05.886203Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.08897"},"observation_digest":"sha256:96afbf23d915b95f4c79909d1e9c97cd98d7f5e9aa871d48422b96cb3d9b4d17","observation_id":"971047b2-6ec5-4a9c-bd29-1a94300b605d","resolution":{"observed_at":"2026-08-07T05:03:05.886203Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T00:48:32.404688Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.12661","last_updated":"2025-06-14T23:40:49Z","snapshot_observed_at":"2026-08-12T09:44:35.810308Z","submitted_at":"2025-06-14T23:40:49Z","title":"INTERPOS: Interaction Rhythm Guided Positional Morphing for Mobile App Recommender Systems","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:48:32.404688Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.12661"},"observation_digest":"sha256:d20f7c461312f4a231eb5635d4ad1ed748b7d467bfd0257c27a349addf109de1","observation_id":"c3ca5301-2edb-495a-8560-43cc0edb9e08","resolution":{"observed_at":"2026-08-07T00:48:32.404688Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T23:57:09.015903Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.16316","last_updated":"2025-06-19T13:45:57Z","snapshot_observed_at":"2026-08-12T17:46:43.849708Z","submitted_at":"2025-06-19T13:45:57Z","title":"Bayesian Optimization over Bounded Domains with the Beta Product Kernel","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T23:57:09.015903Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.16316"},"observation_digest":"sha256:477ce49e425cd9e6661eb9b204e95aeb433a14a669b5976837072ae5eec46030","observation_id":"30ca3ff0-b1d9-4329-933d-c83764011fbb","resolution":{"observed_at":"2026-08-06T23:57:09.015903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T23:12:35.825141Z","title":"Deberta: Decoding- enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.19312","last_updated":"2025-06-24T04:58:55Z","snapshot_observed_at":"2026-08-12T13:57:42.210892Z","submitted_at":"2025-06-24T04:58:55Z","title":"Capturing Fine-Grained Alignments Improves 3D Affordance Detection","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-06T23:12:35.825141Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.19312"},"observation_digest":"sha256:28247b1b7d64b37ac889ba7af20eef5fa4b8a3d79c2300221584102736eee923","observation_id":"9fd8db11-7c57-4f99-b177-d96c9eaca4d9","resolution":{"observed_at":"2026-08-06T23:12:35.825141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T22:46:32.370313Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.20822","last_updated":"2025-06-25T20:43:04Z","snapshot_observed_at":"2026-08-12T03:58:37.460499Z","submitted_at":"2025-06-25T20:43:04Z","title":"Uncovering Hidden Violent Tendencies in LLMs: A Demographic Analysis via Behavioral Vignettes","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T22:46:32.370313Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.20822"},"observation_digest":"sha256:5d4ce5d88f693ecbf87507283831a13179b761a7a52f7cc94b0941414b0c9612","observation_id":"de8e3e30-c0c6-491e-b1c0-7421c9ee5407","resolution":{"observed_at":"2026-08-06T22:46:32.370313Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T04:37:29.907111Z","title":"arXiv preprint arXiv:2006.03654 (2020)","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.21560","last_updated":"2025-07-27T00:45:00Z","snapshot_observed_at":"2026-08-10T22:45:07.086591Z","submitted_at":"2025-06-11T22:49:42Z","title":"Reinforcement learning fine-tuning of language model for instruction following and math reasoning","version":2},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T04:37:29.907111Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.21560"},"observation_digest":"sha256:fcf0ba3e300f61ca36a035609eaa418fa1a01a57be3f5f93f53503c46b0b172c","observation_id":"5a2ca701-2b9b-4b81-b3e4-abec734aa4bc","resolution":{"observed_at":"2026-08-07T04:37:29.907111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-07T04:51:45.199813Z","title":"Deberta: Decoding-enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.21803","last_updated":"2025-06-11T07:22:17Z","snapshot_observed_at":"2026-08-09T07:01:29.601343Z","submitted_at":"2025-06-11T07:22:17Z","title":"From Token to Rhythm: A Multi-Scale Approach for ECG-Language Pretraining","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-07T04:51:45.199813Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.21803"},"observation_digest":"sha256:4de2e49e895fe9c7b78f432f792e9e0ce4c04e42f2c3e21184834a33ba31a9ac","observation_id":"48c925fc-a887-4e0d-b6f4-0564cbefb1e7","resolution":{"observed_at":"2026-08-07T04:51:45.199813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T22:05:27.383439Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2506.22716","last_updated":"2025-06-28T01:52:50Z","snapshot_observed_at":"2026-08-10T21:18:17.869089Z","submitted_at":"2025-06-28T01:52:50Z","title":"BEST-Route: Adaptive LLM Routing with Test-Time Optimal Compute","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T22:05:27.383439Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2506.22716"},"observation_digest":"sha256:7dbee5f7f02a1f3af9e2cf85f3e30efb33e3ae627cb201cc1b1271129cdae9db","observation_id":"f0103ed7-d55a-4672-90ba-7c33e4e5d8e7","resolution":{"observed_at":"2026-08-06T22:05:27.383439Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T17:24:37.253151Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11042","last_updated":"2025-07-15T07:11:29Z","snapshot_observed_at":"2026-08-11T05:13:21.966624Z","submitted_at":"2025-07-15T07:11:29Z","title":"Aligned Query Expansion: Efficient Query Expansion for Information Retrieval through LLM Alignment","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-06T17:24:37.253151Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.11042"},"observation_digest":"sha256:3f26abe18faf809ddb88238349a037324d37de1f2e475bb7d9999fea83efb4c4","observation_id":"e2891f21-efa8-42c8-9b33-8095921fd4f2","resolution":{"observed_at":"2026-08-06T17:24:37.253151Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T17:44:08.049023Z","title":"Deberta: Decoding- enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.11559","last_updated":"2025-07-14T09:26:26Z","snapshot_observed_at":"2026-08-06T17:37:20.577541Z","submitted_at":"2025-07-14T09:26:26Z","title":"RSD-15K: A Large-Scale User-Level Annotated Dataset for Suicide Risk Detection on Social Media","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-06T17:44:08.049023Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.11559"},"observation_digest":"sha256:323b53959ab410977c8f89c83c2990a1f105e0cfc7306bf9dc1f92a36cf81cf0","observation_id":"399ff1be-0778-4f97-8c59-d3e0d3f93373","resolution":{"observed_at":"2026-08-06T17:44:08.049023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T17:11:31.842872Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.11634","last_updated":"2025-07-15T18:13:25Z","snapshot_observed_at":"2026-08-09T17:59:13.260918Z","submitted_at":"2025-07-15T18:13:25Z","title":"Cross-lingual Few-shot Learning for Persian Sentiment Analysis with Incremental Adaptation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-06T17:11:31.842872Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.11634"},"observation_digest":"sha256:1347194464164c0d0f6a45ec06e48cf7ca24a39a60ef892dd462e92d91d9eee5","observation_id":"e3f3bfe5-dfe2-4a85-8500-a9156eba3f1c","resolution":{"observed_at":"2026-08-06T17:11:31.842872Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T15:56:02.600887Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.14649","last_updated":"2025-07-19T14:48:24Z","snapshot_observed_at":"2026-08-10T13:42:29.828270Z","submitted_at":"2025-07-19T14:48:24Z","title":"Cleanse: Uncertainty Estimation Approach Using Clustering-based Semantic Consistency in LLMs","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T15:56:02.600887Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.14649"},"observation_digest":"sha256:2dcb32ec37c82e73b710b43aaf7f2f390c67ea7cb524e7ee5d01a70affec96cb","observation_id":"0b2567c3-a05e-4e1d-a3c6-fcc36739036a","resolution":{"observed_at":"2026-08-06T15:56:02.600887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T15:47:06.195190Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2507.15087","last_updated":"2025-07-20T19:02:07Z","snapshot_observed_at":"2026-08-07T22:04:53.746056Z","submitted_at":"2025-07-20T19:02:07Z","title":"Evaluation of Coding Schemes for Transformer-based Gene Sequence Modeling","version":1},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-06T15:47:06.195190Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.15087"},"observation_digest":"sha256:a464d1e6765b21dd4563515a9ce0ec3eff2237eca7fd1d6d488483d14f656c21","observation_id":"b1b1368b-749f-42df-95d1-3e860f4c49f5","resolution":{"observed_at":"2026-08-06T15:47:06.195190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-06T12:53:46.489621Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2507.21419","last_updated":"2025-07-29T01:03:00Z","snapshot_observed_at":"2026-08-06T12:53:44.170496Z","submitted_at":"2025-07-29T01:03:00Z","title":"GovRelBench:A Benchmark for Government Domain Relevance","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T12:53:46.489621Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2507.21419"},"observation_digest":"sha256:cbb19949675790265e6bafa18465991a90ee91d710cffc9534445a071a0cd8f5","observation_id":"b6e0cd1f-bf94-48dc-b1f2-889367d11953","resolution":{"observed_at":"2026-08-06T12:53:46.489621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T23:59:35.964417Z","title":"JMIR mental health, 11(1):e57400","venue":null,"work_id":null,"year":1959},"citing_paper":{"arxiv_id":"2508.04531","last_updated":"2025-08-06T15:13:24Z","snapshot_observed_at":"2026-08-12T09:20:00.980856Z","submitted_at":"2025-08-06T15:13:24Z","title":"Unveiling the Landscape of Clinical Depression Assessment: From Behavioral Signatures to Psychiatric Reasoning","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-05T23:59:35.964417Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.04531"},"observation_digest":"sha256:e9f5b8db71f76720a3d96e5bd38fb2d7d0c397a757b1f7e925af57fa1212a925","observation_id":"acdfdc17-1f13-491d-b4b2-0075241200d1","resolution":{"observed_at":"2026-08-05T23:59:35.964417Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T21:03:14.940721Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2508.09516","last_updated":"2025-08-13T05:55:53Z","snapshot_observed_at":"2026-08-11T19:50:50.217056Z","submitted_at":"2025-08-13T05:55:53Z","title":"Cross-lingual Aspect-Based Sentiment Analysis: A Survey on Tasks, Approaches, and Challenges","version":1},"reference_index":130,"source":"pdf_text","source_observed_at":"2026-08-05T21:03:14.940721Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.09516"},"observation_digest":"sha256:c97d39f813cdda6e968613b8f372bd87d69fad16d7b5355da2b0acaaabc6e365","observation_id":"df04ea46-9f13-4704-a814-a33282c8e40c","resolution":{"observed_at":"2026-08-05T21:03:14.940721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T20:25:11.900673Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.10615","last_updated":"2025-08-14T13:12:29Z","snapshot_observed_at":"2026-08-12T17:56:49.792857Z","submitted_at":"2025-08-14T13:12:29Z","title":"FuXi-\\beta: Towards a Lightweight and Fast Large-Scale Generative Recommendation Model","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-05T20:25:11.900673Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.10615"},"observation_digest":"sha256:6a9638d51de4f5515592e60bc3f091d082886ffabed58af5f0f0c927067a70de","observation_id":"08221a33-d5c7-470e-80b3-934e3da6d55b","resolution":{"observed_at":"2026-08-05T20:25:11.900673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":"2006.03654","doi":"10.48550/arxiv.2006.03654","metadata_source":"pith","pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","venue":"cs.CL","work_id":"cb3211f6-363f-4355-bb84-2ecfd7e78875","year":2020},"citing_paper":{"arxiv_id":"2508.16860","last_updated":"2026-04-16T19:07:29Z","snapshot_observed_at":"2026-08-02T12:02:11.673336Z","submitted_at":"2025-08-23T01:10:42Z","title":"TriagerX: Dual Transformers for Bug Triaging Tasks with Content and Interaction Based Rankings","version":2},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-05-18T21:50:56.743486Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.16860"},"observation_digest":"sha256:5931385f8e1fff2014212f1e0d13b50077a108cb4a12011d2d4011314fb159e2","observation_id":"1a4f93aa-bb0e-4d93-8bb3-5f107a8a324c","resolution":{"observed_at":"2026-05-18T21:51:51.625492Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T16:38:46.242749Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2508.18164","last_updated":"2025-08-25T16:13:42Z","snapshot_observed_at":"2026-08-11T17:21:57.775860Z","submitted_at":"2025-08-25T16:13:42Z","title":"S2Sent: Nested Selectivity Aware Sentence Representation Learning","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-05T16:38:46.242749Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.18164"},"observation_digest":"sha256:e89f85207bbc17531c640d5633b0fdd579adde903f0c3b90646b5efa2eeb765d","observation_id":"1d9ca688-7df8-424a-a827-7bf2d24e15e1","resolution":{"observed_at":"2026-08-05T16:38:46.242749Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T15:49:40.077392Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.19467","last_updated":"2025-08-26T23:09:43Z","snapshot_observed_at":"2026-08-12T09:20:21.120692Z","submitted_at":"2025-08-26T23:09:43Z","title":"Inference Gap in Domain Expertise and Machine Intelligence in Named Entity Recognition: Creation of and Insights from a Substance Use-related Dataset","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-05T15:49:40.077392Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.19467"},"observation_digest":"sha256:faffaaa1711487492abf001c5b965468f6bd13f083bff86e7f1b6ee6de31aaa7","observation_id":"69ab50d1-311a-4645-9992-9f6b2ec637cc","resolution":{"observed_at":"2026-08-05T15:49:40.077392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T14:38:15.915245Z","title":"Deberta: Decoding-enhanced bert with disentangled attention,","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2508.21156","last_updated":"2025-08-28T18:46:37Z","snapshot_observed_at":"2026-08-05T14:38:13.528725Z","submitted_at":"2025-08-28T18:46:37Z","title":"Automated Bug Triaging using Instruction-Tuned Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-05T14:38:15.915245Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2508.21156"},"observation_digest":"sha256:a7443c8a2fcc5756ead4eb7efc48fe1c6fc23794a197d7d18dc65d1f3779d3b2","observation_id":"913c0147-4360-42d8-8a98-eed851824c1c","resolution":{"observed_at":"2026-08-05T14:38:15.915245Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T16:06:48.854403Z","title":"Deberta: Decoding -enhanced bert with disentangled attention","venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.00069","last_updated":"2025-08-26T12:45:13Z","snapshot_observed_at":"2026-08-07T09:02:57.595281Z","submitted_at":"2025-08-26T12:45:13Z","title":"AnomalyExplainer Explainable AI for LLM-based anomaly detection using BERTViz and Captum","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-05T16:06:48.854403Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2509.00069"},"observation_digest":"sha256:fae16e33d44eb0ba60b8e84693daae0a529b82dadd7de2718558bc8d9471208b","observation_id":"0bd9258e-dabc-4189-a7c9-4202b94577c5","resolution":{"observed_at":"2026-08-05T16:06:48.854403Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T13:17:39.536887Z","title":null,"venue":null,"work_id":null,"year":2006},"citing_paper":{"arxiv_id":"2509.00806","last_updated":"2025-08-31T11:40:02Z","snapshot_observed_at":"2026-08-10T10:19:14.017478Z","submitted_at":"2025-08-31T11:40:02Z","title":"CaresAI at BioCreative IX Track 1 -- LLM for Biomedical QA","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-05T13:17:39.536887Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2509.00806"},"observation_digest":"sha256:47b65090c4c8bc64bf06543da4bc2f294d74a4136b3b2f68e7c12c41ea7c1d1b","observation_id":"6c18cd28-9fd7-4d3a-9815-241de4385c29","resolution":{"observed_at":"2026-08-05T13:17:39.536887Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2006.03654","snapshot_observed_at":"2026-08-05T12:22:56.633650Z","title":", author Liu, X","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2509.01640","last_updated":"2025-09-01T17:33:19Z","snapshot_observed_at":"2026-08-05T12:22:51.882159Z","submitted_at":"2025-09-01T17:33:19Z","title":"TransGAT: Transformer-Based Graph Neural Networks for Multi-Dimensional Automated Essay Scoring","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-05T12:22:56.633650Z"},"links":{"cited_paper":"/paper/2006.03654","citing_paper":"/paper/2509.01640"},"observation_digest":"sha256:2a214bf579c9e170b00a8e4e2b775efdd758476d98571a74742066294feb3676","observation_id":"b8ee4eac-2839-464f-8f12-01b96e1084f8","resolution":{"observed_at":"2026-08-05T12:22:56.633650Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2006.03654/citation-record","integrity":"/paper/2006.03654/integrity","json":"/paper/2006.03654/citation-record.json","paper":"/paper/2006.03654"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-08-12T08:59:05.030983Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:fad68f5322913d2b8b41732cddf42b4aeed77c86486ff0b8260c5d23d37c3d06","observation_id":"7ca0e485-5098-42d6-a714-ba76932499bd","resolution":{"observed_at":"2026-05-13T04:50:53.639387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.05150","last_updated":"2020-12-02T17:52:35Z","snapshot_observed_at":"2026-07-31T17:17:17.205582Z","submitted_at":"2020-04-10T17:54:09Z","title":"Longformer: The Long-Document Transformer","version":2},"cited_work":{"arxiv_id":"2004.05150","doi":"10.48550/arxiv.2004.05150","metadata_source":"pith","pith_arxiv_id":"2004.05150","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Longformer: The Long-Document Transformer","venue":"cs.CL","work_id":"abea7a44-6668-4de7-aab6-f53a6e5aa088","year":2020},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2004.05150","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:45bbeb7bd9b80d0f5836faecf2b1b2e6e293afb69e9b67d1625b21bb9a581dfe","observation_id":"d1041589-d5f8-484b-a6e7-110ebfbfe69e","resolution":{"observed_at":"2026-05-13T04:50:53.614098Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.161233+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":"2005.14165","doi":"10.1145/1926385.1926423","metadata_source":"pith","pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Language Models are Few-Shot Learners","venue":"cs.CL","work_id":"214732c0-2edd-44a0-af9e-28184a2b8279","year":2020},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:63c3bc6ca562fcd6a8fa907b7c1d3958e4a5cdb9f36ba0683c17773fb8611164","observation_id":"de7075f8-bd9e-44dd-9d8c-d2604e38774e","resolution":{"observed_at":"2026-05-13T04:50:53.617499Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T08:48:33.42086+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1708.00055","last_updated":"2017-07-31T20:12:06Z","snapshot_observed_at":"2026-08-04T03:50:51.013049Z","submitted_at":"2017-07-31T20:12:06Z","title":"SemEval-2017 Task 1: Semantic Textual Similarity - Multilingual and Cross-lingual Focused Evaluation","version":1},"cited_work":{"arxiv_id":"1708.00055","doi":null,"metadata_source":"pith","pith_arxiv_id":"1708.00055","snapshot_observed_at":"2026-07-04T20:00:08.867761Z","title":"SemEval-2017 Task 1: Semantic Textual Similarity - Multilingual and Cross-lingual Focused Evaluation","venue":"cs.CL","work_id":"b884e540-64cb-4ba2-8bc3-ed507116ef2c","year":2017},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1708.00055","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:d1dd473d3bc573db0c681bd2bb6d719022e761574a917e882745511aef53811f","observation_id":"9f1a602f-8de5-4944-8023-3b9375cc1505","resolution":{"observed_at":"2026-05-13T04:50:53.621159Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.02339","last_updated":"2020-08-02T03:18:59Z","snapshot_observed_at":"2026-08-09T13:09:59.315971Z","submitted_at":"2019-10-05T22:57:04Z","title":"Mapping Natural-language Problems to Formal-language Solutions Using Structured Neural Representations","version":3},"cited_work":{"arxiv_id":"1910.02339","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.02339","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Natural-to formal-language generation using tensor product representations","venue":null,"work_id":"18e3460a-0868-47e3-a309-b52a5583066d","year":1910},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1910.02339","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:05fe4e00bbc9d123f2f100b936b3e133b6a22d5362648890377131a2d97b93a2","observation_id":"a9d6f719-8909-435a-85cf-6a6d9f0fbc85","resolution":{"observed_at":"2026-05-13T04:50:53.625453Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-08-09T19:46:04.857927Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:33fe365d33d0869339cefda37ca9805a773bc1855fb891b8adcfc1274d649676","observation_id":"c309315a-fd4f-47e1-9eca-1481c5b41300","resolution":{"observed_at":"2026-05-13T04:50:53.628989Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BoolQ: Exploring the surprising difﬁculty of natural yes/no questions","venue":null,"work_id":"cb2ee36a-1231-41d9-993d-ef7910ee1977","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:fa4cf8569382a6f58eecb11ecaa72eeb486d5157bd04ae15dded1b73eaaf7844","observation_id":"93466457-881d-49fe-b764-5a02e223af2f","resolution":{"observed_at":"2026-05-13T04:50:53.713585Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bert: Pre-training of deep bidirectional transformers for language understanding","venue":null,"work_id":"693b70ad-3022-4615-938e-7752341ec181","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:09bf3ec4ad367d44efe9f7e9a1b6424f71dc8d1ef7b1e48e2ee1e858a65e6e0e","observation_id":"efa5a2bd-3957-4fa5-bcf8-6f4b0d391a9c","resolution":{"observed_at":"2026-05-13T04:50:53.704302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatically constructing a corpus of sentential paraphrases","venue":null,"work_id":"b7d80546-2873-4fba-8ded-dbf4804d3fdf","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:2cd0f6991bf5b51d3de6b617e53624b9fe4305e07f37e3468f3dc51b3f17c2b4","observation_id":"b56d00c7-ce6b-4c4b-887d-508183b9eb5b","resolution":{"observed_at":"2026-05-13T04:50:53.706411Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.03961","last_updated":"2022-06-16T20:36:07Z","snapshot_observed_at":"2026-08-11T09:09:15.043235Z","submitted_at":"2021-01-11T16:11:52Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","version":3},"cited_work":{"arxiv_id":"2101.03961","doi":"10.1214/18-ejs1395","metadata_source":"pith","pith_arxiv_id":"2101.03961","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Switch Transformers: Scaling to Trillion Parameter Models with Simple and Efficient Sparsity","venue":"cs.LG","work_id":"f43c4955-a965-4897-a11b-c4b25d2aeaa8","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2101.03961","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:2ba16a3eedf89ec250c874ccf83b99448d1506eb239cad6da6c7fd487da3a451","observation_id":"4d9e50cd-5fca-462d-b52d-7eea56ef6a90","resolution":{"observed_at":"2026-05-13T04:50:53.636144Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11983","last_updated":"2019-07-27T21:51:52Z","snapshot_observed_at":"2026-08-12T23:53:40.160899Z","submitted_at":"2019-07-27T21:51:52Z","title":"A Hybrid Neural Network Model for Commonsense Reasoning","version":1},"cited_work":{"arxiv_id":"1907.11983","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1907.11983","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A hybrid neural network model for commonsense reasoning","venue":null,"work_id":"93f55f53-37dc-48cc-8ae3-3641532d454f","year":1907},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1907.11983","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:b96061a9e3d2f76bf1921abd483cdc890367c4140deaacdf0d98ff2ce696fc2d","observation_id":"cf1c1692-06a2-4247-8a3b-12f8c54bf9aa","resolution":{"observed_at":"2026-05-13T04:50:53.632775Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2020.acl-main.197","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mandar Joshi, Danqi Chen, Yinhan Liu, Daniel S Weld, Luke Zettlemoyer, and Omer Levy","venue":null,"work_id":"a901149e-c16c-4d07-a4c3-f26fdee592e1","year":2020},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:adbf8685e3c1c4a29c761a4f846a5438e35af52d941291c31ded1db7fbb6eb50","observation_id":"b5646811-d8b6-4d7f-930d-e5a40c177c09","resolution":{"observed_at":"2026-05-13T04:50:53.609812Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.10847","last_updated":"2021-09-23T06:19:05Z","snapshot_observed_at":"2026-08-12T23:40:00.690444Z","submitted_at":"2021-09-22T17:18:55Z","title":"Small-Bench NLP: Benchmark for small single GPU trained models in Natural Language Processing","version":2},"cited_work":{"arxiv_id":"2109.10847","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2109.10847","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Small-bench nlp: Benchmark for small single gpu trained models in natural language processing","venue":null,"work_id":"00706cd1-e579-413b-89e9-7e3ff17e54a8","year":null},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2109.10847","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:2fbf28a8e5992756721d60f6b8fab85b17497f485b09f10abeeeac2305419a35","observation_id":"610cb5a2-fd02-42a8-a137-3623c776bb86","resolution":{"observed_at":"2026-05-13T04:50:53.642537Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Looking beyond the surface: A challenge set for reading comprehension over multiple sentences","venue":null,"work_id":"f103d3f6-29fe-4ac5-a3be-9bc2eeb91f73","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:afa1738d634f5aa8a90d571c070355e2c9c187e28866512c6b3cd417e9b0c698","observation_id":"f36648d4-d7b3-4d57-b4d0-831e0578bb6a","resolution":{"observed_at":"2026-05-13T04:50:53.718095Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1412.6980","last_updated":"2017-01-30T01:27:54Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2014-12-22T13:54:29Z","title":"Adam: A Method for Stochastic Optimization","version":9},"cited_work":{"arxiv_id":"1412.6980","doi":"10.1002/mrm.28086","metadata_source":"pith","pith_arxiv_id":"1412.6980","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Adam: A Method for Stochastic Optimization","venue":"cs.LG","work_id":"1910796d-9b52-4683-bf5c-de9632c1028b","year":2014},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1412.6980","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:28667b68e6fa3e3b559a8066edfeb4cea08c6c7c3025f77549731d360be55445","observation_id":"d0fdcac7-8c94-462f-a47a-6fda02a0f233","resolution":{"observed_at":"2026-05-13T04:50:53.645380Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Race: Large-scale reading comprehension dataset from examinations","venue":null,"work_id":"28e5b63c-2c6e-4491-b284-cf1244fad13f","year":2017},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:5b6e5f94c52b1ae6479e2d8cd5d104f496bbf88549502cef8b34dc075305bdfc","observation_id":"ade7e4d7-4083-4a6d-a982-33ca647113c7","resolution":{"observed_at":"2026-05-13T04:50:53.722195Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Winograd schema challenge","venue":null,"work_id":"deed3362-0d2f-415c-83e9-667d6aaa51a5","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:1ea2f01e5341e9fb2f9126d1accd4e27e2e0c8b9b7f320cc5105f9e5e5f9078f","observation_id":"f1d9fdb0-6028-4886-8541-85f180108e62","resolution":{"observed_at":"2026-05-13T04:50:53.724379Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.08994","last_updated":"2020-04-29T21:16:31Z","snapshot_observed_at":"2026-07-06T09:13:32.098523Z","submitted_at":"2020-04-20T00:07:18Z","title":"Adversarial Training for Large Neural Language Models","version":2},"cited_work":{"arxiv_id":"2004.08994","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.08994","snapshot_observed_at":"2026-07-01T13:45:45.877574Z","title":"arXiv preprint arXiv:2004.08994 , year=","venue":null,"work_id":"f165f0fe-d307-4dd2-910e-046e892af4e7","year":2004},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2004.08994","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:d037db80d3e76cc25d81c6a7771d26ed670696951cff59cd124993be5777374e","observation_id":"c14f9ae4-4ca9-4814-9f67-8f5951ab12f1","resolution":{"observed_at":"2026-05-13T04:50:53.648799Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":"1907.11692","doi":"10.1007/s10489-02203627-9","metadata_source":"pith","pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","venue":"cs.CL","work_id":"41fe12c4-e538-4890-a244-480650ed3078","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:b9fcda3880b19e4719a4f471f7f6bb30539041abea3b6ba9424cad04577b8ca9","observation_id":"aa4f25a6-5599-4f67-b9a7-369e05bfe402","resolution":{"observed_at":"2026-05-13T04:50:53.652209Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.03705","last_updated":"2021-01-04T07:41:46Z","snapshot_observed_at":"2026-08-09T20:04:09.828554Z","submitted_at":"2020-04-06T02:00:30Z","title":"Deep Learning Based Text Classification: A Comprehensive Review","version":3},"cited_work":{"arxiv_id":"2004.03705","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.03705","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Deep learning based text classiﬁcation: A comprehensive review","venue":null,"work_id":"9a400323-b8eb-40b0-bcd0-1624222ec62d","year":2004},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2004.03705","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:0b115f436db7f633cd4324ddef36cd56f92686a536185c90203d21f071e0cfb7","observation_id":"f8483349-cc98-4e06-858b-4bbcd12a15a9","resolution":{"observed_at":"2026-05-13T04:50:53.655624Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Virtual adversarial training: a regularization method for supervised and semi-supervised learning","venue":null,"work_id":"b733a5ca-42f0-4471-926f-a1529f7617d4","year":1979},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:a053de459fbe322472a1c8f97b95046e6ab56217bf4f7d8310936e8477bcf2e9","observation_id":"f8272f1e-aa62-4347-98d6-5333b976c9ca","resolution":{"observed_at":"2026-05-13T04:50:53.732873Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Wic: the word-in-context dataset for evaluating context-sensitive meaning representations","venue":null,"work_id":"5a94f539-90c8-408b-8480-0c6f01a010d2","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:c2d11e898155c2a0016a89a2ffdd4732a7e909561df49413bcbd64eaeb7be185","observation_id":"00aece18-20b8-4f0c-a497-a36e4cdb9a0f","resolution":{"observed_at":"2026-05-13T04:50:53.681251Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Pranav Rajpurkar, Jian Zhang, Konstantin Lopyrev, and Percy Liang","venue":null,"work_id":"60014cf8-e460-4a55-8a8d-261cead20bcf","year":2016},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:738216241ba95b35706c4694f0d00ba22a728bdf7a9c5e984e044a6f0c0e7b13","observation_id":"7f60e6bd-e0ce-465e-9c6e-f16758b9342c","resolution":{"observed_at":"2026-05-13T04:50:53.684218Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5343a722-9494-4f86-86ce-0d2edbedc5ed","year":2011},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:d830d24f69f0d1dbcebc64eb5960490570b99e9507f4d5871930b543ebf10a83","observation_id":"5c906323-b3ab-40d4-808b-37feb3c3ec8d","resolution":{"observed_at":"2026-05-13T04:50:53.686265Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.06611","last_updated":"2020-11-04T15:28:24Z","snapshot_observed_at":"2026-07-06T08:29:34.087644Z","submitted_at":"2019-10-15T09:19:55Z","title":"Enhancing the Transformer with Explicit Relational Encoding for Math Problem Solving","version":2},"cited_work":{"arxiv_id":"1910.06611","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1910.06611","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Enhancing the transformer with explicit relational encoding for math problem solving","venue":null,"work_id":"e23538e0-aa92-4e93-bafe-6c7d086074fa","year":1910},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1910.06611","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:506b45a7dccb971e0a41cc8aedc6c12bc157e68147a0c55de158f948cebdfb64","observation_id":"1254f68f-6df5-4bae-bec7-9842a63a1903","resolution":{"observed_at":"2026-05-13T04:50:53.658911Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Self-attention with relative position representations","venue":null,"work_id":"86558770-c3a3-4143-9c2b-0cb3c901d28b","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:b07bb0c0381e4353f0c16956f00154fab0f2173d9a5ad73e61f393b9c13f7010","observation_id":"9406db19-4924-4a37-b390-1737ccff2514","resolution":{"observed_at":"2026-05-13T04:50:53.691450Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2004.14224","last_updated":"2020-04-29T14:22:42Z","snapshot_observed_at":"2026-08-10T23:30:18.007731Z","submitted_at":"2020-04-29T14:22:42Z","title":"Exploiting Structured Knowledge in Text via Graph-Guided Representation Learning","version":1},"cited_work":{"arxiv_id":"2004.14224","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2004.14224","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Ex- ploiting structured knowledge in text via graph-guided representation learning","venue":null,"work_id":"37c1c279-0f8b-4a2c-a049-418d5efe164e","year":2004},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/2004.14224","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:0da0406186eaa42fc1235bcbb6a6984d8f837f00b9b19492da61fc0d8b5e26b4","observation_id":"46c72c95-bf5d-492b-af5b-ad86ea7077c3","resolution":{"observed_at":"2026-05-13T04:50:53.662075Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:14f3b27ba7a81c78ed5e0beafef1554d8259adce9725bf48907b4d450eb64d50","observation_id":"75df99bf-b7de-470f-8b0e-5154a04a4374","resolution":{"observed_at":"2026-05-13T04:50:53.664901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Recursive deep models for semantic compositionality over a sentiment treebank","venue":null,"work_id":"c094552e-aba9-41e3-8b6a-0d6bebbe46f8","year":2013},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:34f75fdcebfad4148b564649bb189bc04b469cf3fb3e99bafce36847bba00f03","observation_id":"55c50582-c591-4643-9e60-795cb2fa5547","resolution":{"observed_at":"2026-05-13T04:50:53.698963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09223","last_updated":"2019-04-19T15:10:56Z","snapshot_observed_at":"2026-08-12T12:57:45.707049Z","submitted_at":"2019-04-19T15:10:56Z","title":"ERNIE: Enhanced Representation through Knowledge Integration","version":1},"cited_work":{"arxiv_id":"1904.09223","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09223","snapshot_observed_at":"2026-07-04T20:00:08.484855Z","title":"ERNIE: Enhanced Representation through Knowledge Integration","venue":"cs.CL","work_id":"a829005c-adb4-4919-aaaf-e9de8485a823","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1904.09223","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:98f32a70d7c94f95fd55ec72a13dc7ba4818f9dd1da2345833d8390a3fd28900","observation_id":"3ebca442-c62c-406a-8516-265d029a1d28","resolution":{"observed_at":"2026-05-13T04:50:53.668522Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.02847","last_updated":"2019-09-26T22:33:06Z","snapshot_observed_at":"2026-08-12T05:09:07.471615Z","submitted_at":"2018-06-07T18:13:08Z","title":"A Simple Method for Commonsense Reasoning","version":2},"cited_work":{"arxiv_id":"1806.02847","doi":"10.48550/arxiv.1806.02847","metadata_source":"arxiv_reference","pith_arxiv_id":"1806.02847","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Trinh and Quoc V","venue":"arXiv (Cornell University)","work_id":"a8423cfc-3f91-4307-9c05-02cfd6a0c714","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1806.02847","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:648e7bdff761ed200713303072e1fbe53f7fcd15d89b38f031bcc6570304d7ed","observation_id":"2a1863f2-6513-4f97-986f-6512769f94c0","resolution":{"observed_at":"2026-05-13T04:50:53.671890Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04577","last_updated":"2019-09-27T05:44:38Z","snapshot_observed_at":"2026-08-12T02:40:49.495224Z","submitted_at":"2019-08-13T11:12:58Z","title":"StructBERT: Incorporating Language Structures into Pre-training for Deep Language Understanding","version":3},"cited_work":{"arxiv_id":"1908.04577","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.04577","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"InProceedings of the Thirteenth Language Resources and Evalua- tion Conference, pages 2682–2692, Marseille, France","venue":null,"work_id":"367b79a1-2480-4fb7-9fc3-33f0d6a31e3f","year":2023},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1908.04577","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:735f41c1ef5383291513d7df1c4cddf3c9145c1f4343a094640aefefb5098db8","observation_id":"6dcf605b-d1ea-4ff6-94d8-338b6c96991c","resolution":{"observed_at":"2026-05-13T04:50:53.675100Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A broad-coverage challenge corpus for sentence understanding through inference","venue":null,"work_id":"45801a4a-9f1b-4ba3-8361-10c0605d6491","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:a85ab238cd7d3c70762d68fbe4e58fef76887b5c2fcd371f384c0863734bcde5","observation_id":"42630179-d661-465b-a868-dd990c8a37a1","resolution":{"observed_at":"2026-05-13T04:50:53.715737Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Swag: A large-scale adversarial dataset for grounded commonsense inference","venue":null,"work_id":"33c7bd79-0695-48d1-85a0-5b8e0d42c086","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:565939a1309a295de6736267036cd673c0640ba967c2336ef107d11ff8ab9c9d","observation_id":"0b3a58a7-b7c0-4796-83f7-bbd571ade512","resolution":{"observed_at":"2026-05-13T04:50:53.720136Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1810.12885","last_updated":"2018-10-30T17:32:16Z","snapshot_observed_at":"2026-08-06T02:57:51.203477Z","submitted_at":"2018-10-30T17:32:16Z","title":"ReCoRD: Bridging the Gap between Human and Machine Commonsense Reading Comprehension","version":1},"cited_work":{"arxiv_id":"1810.12885","doi":"10.48550/arxiv.1810.12885","metadata_source":"pith","pith_arxiv_id":"1810.12885","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReCoRD: Bridging the Gap between Human and Machine Commonsense Reading Comprehension","venue":"cs.CL","work_id":"0490655f-8d5b-467e-83a2-568b957068c9","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"cited_paper":"/paper/1810.12885","citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:ee5bb6d836f728c54232026f61feac0d5537ffdc76b5667c26fa3c9ae6ae39f3","observation_id":"014dcc84-21e7-4785-bd04-b6142d82c066","resolution":{"observed_at":"2026-05-13T04:50:53.678949Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bae2778a-4403-48e3-bfd1-b453994c3339","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:a4a981e8d25184f11ec1c00365db91acf022a4c42426864b5fcbb0072699e84e","observation_id":"653369c9-df7b-4b08-a5dd-47c264d72191","resolution":{"observed_at":"2026-05-13T04:50:53.728872Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"b3e9b868-72af-4b4a-a909-6717a70692a5","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:67bce91ee2a325ca57bc2275c3a9ffa5331abb521c0c466d5647e46f0bd856fd","observation_id":"9280312f-33a1-4f28-8635-e990d50a18d3","resolution":{"observed_at":"2026-05-13T04:50:53.730715Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Their passages come from approximately 500 Wikipedia articles and the questions and answers are obtained by crowd- sourcing","venue":null,"work_id":"e0467744-f0a4-4d0f-b5e6-c83d0e538901","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:4778f0b0071ef14a908756d7c60d0659e02dd986fe7f44cccc248bbf768f15da","observation_id":"14ca8369-562d-49bd-b38a-fd21577ffa1d","resolution":{"observed_at":"2026-05-13T04:50:53.688593Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The total data size after data deduplication(Shoeybi et al","venue":null,"work_id":"b80ebe4e-5fed-404a-90ea-f89c35e64db8","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:7dd8dec71815e66fbac69aa991e598d856ba9208a8f69cec0c1faebb86251bf5","observation_id":"820dc5cb-2f39-41f5-8361-4a64ac420e44","resolution":{"observed_at":"2026-05-13T04:50:53.694189Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"For ﬁne-tuning, even though we can get better and robust results with RAdam(Liu et al., 2019a) on some tasks, e.g","venue":null,"work_id":"ee97b3d8-30ea-45b8-b0d9-b09b2962f002","year":2018},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:ceefa34f2a4b92d50c39dcd21cabbd16dc98e9d2c38d9ce8b0e4a22c9f946a46","observation_id":"4f8e554e-fb56-426f-a3a9-0023dd2235d4","resolution":{"observed_at":"2026-05-13T04:50:53.696613Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Our code is implemented based on Huggingface Transformers11, FairSeq12 and Megatron (Shoeybi et al., 2019)13","venue":null,"work_id":"b6cd73e3-1af3-4a84-9100-567c1125941d","year":2019},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:6314fc1e57cf87273b0e7d85f8d462d38ed0d53c9f27b1b5b0f009aee603dd21","observation_id":"854e854d-6c46-41ed-a6ca-1e4b3f1a14bf","resolution":{"observed_at":"2026-05-13T04:50:53.701681Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"15592a20-881a-46fd-bd4b-6852b591953a","year":2020},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:b133dfbf9f5a482428d8babfcc87672894da10b9bfe5330cf630c3b9e031bc6a","observation_id":"2f38809d-7c46-4c6b-ad58-e336ff6df665","resolution":{"observed_at":"2026-05-13T04:50:53.708802Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"a”, “the","venue":null,"work_id":"cc766ff4-552d-4a88-bbd9-1892b97f027a","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:56c7f9dc412140a74ab4028dec54c3f0c2c375e870185885799260f171bee112","observation_id":"6aacfee7-3f31-4c4f-b225-d4b0f6d1a90c","resolution":{"observed_at":"2026-05-13T04:50:53.711084Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"21 Published as a conference paper at ICLR 2021 (a) (b) (c) Figure 5: Comparison on attention patterns of last layer between DeBERTa and its variants (i.e","venue":null,"work_id":"285e355d-7966-481f-baeb-9cf27c6c8e55","year":2021},"citing_paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention","version":6},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-05-13T04:50:53.587891Z"},"links":{"citing_paper":"/paper/2006.03654"},"observation_digest":"sha256:def22724c8f983d2bc76c5e5efc512aa17641a352aad9497c5024df6cd416ce6","observation_id":"ee49d42d-7205-4f7d-b3ac-0de009cc80b0","resolution":{"observed_at":"2026-05-13T04:50:53.726586Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2006.03654","last_updated":"2021-10-06T21:02:00Z","latest_version":6,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T09:26:29.068023Z","submitted_at":"2020-06-05T19:54:34Z","title":"DeBERTa: Decoding-enhanced BERT with Disentangled Attention"},"reference_resolution":{"displayed":44,"state_counts":{"malformed_identifier":1,"metadata_mismatch":3,"parse_uncertain":0,"unresolved":3,"verified_exact":18,"verified_fuzzy":19},"total_outbound_references":44},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 13 August 2026, this Paper Citation Record lists 44 of 44 outbound references and 100 inbound Pith citation observations for arXiv:2006.03654."}