{"as_of":"2026-08-05T02:06:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:98983bb31609ce21c158e9fbf35892fd98b0fb56389473f23b8fd597b01df8e2","coverage":[{"denominator":294,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-10T20:53:16.720145Z","state":"measured"},{"denominator":200,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":200,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-04T06:34:03.388597+00:00","state":"measured"},{"denominator":331,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-11T11:50:26.030339Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-07-11T03:37:45.880117Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2202.07646","last_updated":"2023-03-06T06:28:18Z","snapshot_observed_at":"2026-08-03T19:51:05.627063Z","submitted_at":"2022-02-15T18:48:31Z","title":"Quantifying Memorization Across Neural Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T22:04:59.678438Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2202.07646"},"observation_digest":"sha256:4f01cbd4e874027972524e9f95afe947246eeb0150ca7fca8d267ddff59de45a","observation_id":"a9b074d9-e330-4572-8a17-442d1313d7e8","resolution":{"observed_at":"2026-05-13T22:04:59.715819Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2208.07339","last_updated":"2022-11-10T18:14:31Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-08-15T17:08:50Z","title":"LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale","version":2},"reference_index":176,"source":"arxiv_source","source_observed_at":"2026-05-13T13:35:35.972596Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2208.07339"},"observation_digest":"sha256:ed29d37a433d510a69e2add1096ede162117fa2f44b32a7cd4d9082c278c11e4","observation_id":"26cfedbd-439c-49f2-a71d-aa1e9a7db025","resolution":{"observed_at":"2026-05-13T13:35:36.198687Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2209.07753","last_updated":"2023-05-25T03:50:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-09-16T07:17:23Z","title":"Code as Policies: Language Model Programs for Embodied Control","version":4},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-05-15T00:38:02.723424Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2209.07753"},"observation_digest":"sha256:7d9be3e2407c9416c4335a19abfefd9f47c8ee0c623754c6e4190a8113271606","observation_id":"cf95a2e9-5990-422d-ac89-bd75aebd0fad","resolution":{"observed_at":"2026-05-15T00:38:02.821501Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2210.17323","last_updated":"2023-03-22T13:10:47Z","snapshot_observed_at":"2026-07-31T03:44:36.976336Z","submitted_at":"2022-10-31T13:42:40Z","title":"GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-10T17:18:35.153078Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2210.17323"},"observation_digest":"sha256:71cea19d3d32309aa3aa8b243ec775bd237856445f4c315d283dd056643d3f8f","observation_id":"adf6bee6-9dea-4b8a-98b2-779dc58da911","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2211.01910","last_updated":"2023-03-10T17:20:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-03T15:43:03Z","title":"Large Language Models Are Human-Level Prompt Engineers","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T09:43:26.288866Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2211.01910"},"observation_digest":"sha256:b522192b380a545b60ef7942087bf35b84988f36086bf8bf7e822651cd070878","observation_id":"34d733b8-7c49-4969-9f20-32340de1916d","resolution":{"observed_at":"2026-05-24T09:43:26.376017Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:eddd15d8faba46c255365edd6aed93ff42b0ed2a83a48ba3fb934d930d91f90c","observation_id":"558f711d-2ac9-44e6-ae45-049084f11080","resolution":{"observed_at":"2026-05-13T05:53:21.938061Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":256,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:cfd51202e46c2257ca9b5c4ea4021654f037d6e3510cc80ba9bca5e6eee5bfd5","observation_id":"14d4cf35-e2e4-4ac9-bd30-7a7e6254b206","resolution":{"observed_at":"2026-05-13T05:53:22.301040Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2211.09527","last_updated":"2022-11-17T13:43:20Z","snapshot_observed_at":"2026-07-06T14:19:47.424778Z","submitted_at":"2022-11-17T13:43:20Z","title":"Ignore Previous Prompt: Attack Techniques For Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-11T13:59:31.213830Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2211.09527"},"observation_digest":"sha256:7a79568e578c0f997b80cc73b4116e75dc87a3c5bef87977b8efe12db959980d","observation_id":"a5c31ed7-a900-4099-b22f-6da87cfd40ff","resolution":{"observed_at":"2026-05-11T13:59:31.482795Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2301.12597","last_updated":"2023-06-15T07:57:29Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-01-30T00:56:51Z","title":"BLIP-2: Bootstrapping Language-Image Pre-training with Frozen Image Encoders and Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-05-12T00:10:48.610351Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2301.12597"},"observation_digest":"sha256:e44ae7b61e473928691ef9fe41a601caf04b04fa417626373b946c3d0a0f4d67","observation_id":"48261357-abe8-4ab1-85a5-e4dae8157e6f","resolution":{"observed_at":"2026-05-12T00:10:50.365617Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2301.12652","last_updated":"2023-05-24T05:08:07Z","snapshot_observed_at":"2026-08-02T02:08:12.414817Z","submitted_at":"2023-01-30T04:18:09Z","title":"REPLUG: Retrieval-Augmented Black-Box Language Models","version":4},"reference_index":160,"source":"arxiv_source","source_observed_at":"2026-05-17T12:41:53.833754Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2301.12652"},"observation_digest":"sha256:66b35453a71851c8a66f58a3039da1e517de3c4e86d05990a195ceb1e19abcb4","observation_id":"755c06ec-f718-4357-86da-552a56b5fce8","resolution":{"observed_at":"2026-05-17T12:41:54.028271Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2301.13688","last_updated":"2023-02-14T16:33:33Z","snapshot_observed_at":"2026-07-06T14:46:37.657675Z","submitted_at":"2023-01-31T15:03:44Z","title":"The Flan Collection: Designing Data and Methods for Effective Instruction Tuning","version":2},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-05-24T09:13:30.054153Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2301.13688"},"observation_digest":"sha256:23d3478dd1067bec5be6ba3556455d0f31ed3173f3d3549358e331573a601892","observation_id":"6c44102c-db25-4f48-82e0-b50ca30988da","resolution":{"observed_at":"2026-05-24T09:14:16.389868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2302.01560","last_updated":"2024-07-08T05:56:47Z","snapshot_observed_at":"2026-08-02T14:50:04.461434Z","submitted_at":"2023-02-03T06:06:27Z","title":"Describe, Explain, Plan and Select: Interactive Planning with Large Language Models Enables Open-World Multi-Task Agents","version":3},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-05-16T03:27:40.524895Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2302.01560"},"observation_digest":"sha256:5a352857096b34d1311b29630ebb625b6594f4a01baf0916e5fb4b99878c858a","observation_id":"fd909242-29d5-4a72-bae9-8494886ea937","resolution":{"observed_at":"2026-05-16T03:27:40.636530Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2302.09664","last_updated":"2023-04-15T12:55:45Z","snapshot_observed_at":"2026-07-06T14:53:27.667483Z","submitted_at":"2023-02-19T20:10:07Z","title":"Semantic Uncertainty: Linguistic Invariances for Uncertainty Estimation in Natural Language Generation","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-12T18:00:05.294144Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2302.09664"},"observation_digest":"sha256:52ee7ed76bf523f7674a188f0b1301783aaa592e4e5ad85c297f6c89c1aa081a","observation_id":"c1b738cf-c8ed-4faf-ad3f-04d8d6f41220","resolution":{"observed_at":"2026-05-12T18:00:05.352851Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.08112","last_updated":"2025-11-11T01:13:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-14T17:47:09Z","title":"Eliciting Latent Predictions from Transformers with the Tuned Lens","version":6},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-12T16:54:37.382049Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.08112"},"observation_digest":"sha256:7f373b6a4daabfb008450da0bd83f648b8f9cf2f606e85221123e0ec7a8f6031","observation_id":"c5694773-9e95-4dd4-9fdb-2939d16d3210","resolution":{"observed_at":"2026-05-12T16:54:37.437329Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.08896","last_updated":"2023-10-11T17:43:28Z","snapshot_observed_at":"2026-07-06T15:03:55.982628Z","submitted_at":"2023-03-15T19:31:21Z","title":"SelfCheckGPT: Zero-Resource Black-Box Hallucination Detection for Generative Large Language Models","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-15T15:11:21.589770Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.08896"},"observation_digest":"sha256:b1fbc04a5e4df5c200e93ec135ce2d95e757894ab2f2adf98e3a340e9b81838f","observation_id":"cd32c958-18f8-4fd1-8e02-85b0dfdce470","resolution":{"observed_at":"2026-05-15T15:11:21.843976Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.09540","last_updated":"2023-03-22T17:22:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-16T17:53:24Z","title":"SemDeDup: Data-efficient learning at web-scale through semantic deduplication","version":3},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-05-18T02:43:30.851915Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.09540"},"observation_digest":"sha256:b136059ecc62fa7aef2dc515680b8b9938bcad7627abaa11e33bb5f0b53f6a53","observation_id":"ab09c90c-ca7b-4bf0-b2d9-b879472102fa","resolution":{"observed_at":"2026-05-18T02:43:31.004497Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.11156","last_updated":"2025-01-17T04:21:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-17T17:53:19Z","title":"Can AI-Generated Text be Reliably Detected?","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-20T19:29:45.315242Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.11156"},"observation_digest":"sha256:f8a5c346c9f7ccc6d8cbbb8b74c26d773392e42f4515b0f68d7c3a13531efe07","observation_id":"738eebac-8e0c-4296-9f20-65167b430997","resolution":{"observed_at":"2026-05-20T19:29:45.435500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.11156","last_updated":"2025-01-17T04:21:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-17T17:53:19Z","title":"Can AI-Generated Text be Reliably Detected?","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-20T19:29:45.315242Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.11156"},"observation_digest":"sha256:11b864e4ab28d313f3c413af1704b949e59bbeb07844a11808c69d78bc7b9ca0","observation_id":"e38ac9c9-f5d2-4340-a335-b48e6f61a957","resolution":{"observed_at":"2026-05-20T19:29:45.386876Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.16199","last_updated":"2024-09-18T23:54:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-28T17:59:12Z","title":"LLaMA-Adapter: Efficient Fine-tuning of Language Models with Zero-init Attention","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-14T23:07:42.245641Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.16199"},"observation_digest":"sha256:da7f64a252590aac2138a388d8143a57ad10455fec23272accb5307ff6c8056d","observation_id":"e22c41d7-270b-4be6-a936-30cd48294d75","resolution":{"observed_at":"2026-05-14T23:07:42.593407Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.17564","last_updated":"2023-12-21T06:21:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T17:30:36Z","title":"BloombergGPT: A Large Language Model for Finance","version":3},"reference_index":139,"source":"arxiv_source","source_observed_at":"2026-05-13T23:19:46.231145Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.17564"},"observation_digest":"sha256:519ffd370e94d77e0fbc30d74d650cd04d0074bc9a9c040d9c5c3ed8d091418b","observation_id":"c4245c76-0157-4c77-a02e-781ff02c8728","resolution":{"observed_at":"2026-05-13T23:19:46.890114Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.17580","last_updated":"2023-12-03T18:17:21Z","snapshot_observed_at":"2026-08-03T00:52:54.308486Z","submitted_at":"2023-03-30T17:48:28Z","title":"HuggingGPT: Solving AI Tasks with ChatGPT and its Friends in Hugging Face","version":4},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-14T00:06:45.440071Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.17580"},"observation_digest":"sha256:47c079a178b60e9bb7bbc508eaef95182728f8fe529acbf488c60b35f3f2c64a","observation_id":"0be7d67d-db92-4426-883d-75cd10358ae1","resolution":{"observed_at":"2026-05-14T00:06:45.593745Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.17760","last_updated":"2023-11-02T17:34:57Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-31T01:09:00Z","title":"CAMEL: Communicative Agents for \"Mind\" Exploration of Large Language Model Society","version":2},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-14T01:40:53.351795Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.17760"},"observation_digest":"sha256:9dd6f8e8f451611b0251c10ce9696b4ad1d1d0b4a2b394bde5d13e86797a77aa","observation_id":"e97d6091-0ff7-45f1-9425-70664e53e15e","resolution":{"observed_at":"2026-05-14T01:40:53.964150Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2303.18223","last_updated":"2026-03-18T05:34:39Z","snapshot_observed_at":"2026-08-05T01:22:27.893787Z","submitted_at":"2023-03-31T17:28:46Z","title":"A Survey of Large Language Models","version":19},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-05-10T22:46:39.268353Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2303.18223"},"observation_digest":"sha256:99c54f3dfc62cfd572d6b5db14cdd4247efeb04e6803a845435862d9df85976d","observation_id":"4bfaee43-79a5-453d-819c-b9e8776ad7b1","resolution":{"observed_at":"2026-05-10T22:46:39.744688Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.01373","last_updated":"2023-05-31T17:54:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-03T20:58:15Z","title":"Pythia: A Suite for Analyzing Large Language Models Across Training and Scaling","version":2},"reference_index":177,"source":"arxiv_source","source_observed_at":"2026-05-15T17:45:17.540282Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.01373"},"observation_digest":"sha256:a51100662dd9cea50a10c5482fae92012dd6248ce3141fa083e2b432b940a8c3","observation_id":"13bf0c7d-86f4-4648-9e04-cc5924751a23","resolution":{"observed_at":"2026-05-15T17:45:17.659224Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-05-14T17:04:08.782586Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.03277"},"observation_digest":"sha256:ab1fa3822e749af8ff90aed5a368088ebf7adaeb8bd499d3544dd66b490cbb57","observation_id":"d783e0a3-a4d6-43c2-9aef-99482471160c","resolution":{"observed_at":"2026-05-14T17:04:18.162332Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.06364","last_updated":"2023-09-18T14:23:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-13T09:39:30Z","title":"AGIEval: A Human-Centric Benchmark for Evaluating Foundation Models","version":2},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-16T10:03:58.971585Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.06364"},"observation_digest":"sha256:26377d235ed8b4644621b6d61bd67fd193d82d88ce5b31029ca10c5142e4e294","observation_id":"bcf85aca-e9c9-490c-a91b-5ee4cc34586a","resolution":{"observed_at":"2026-05-16T10:03:59.386291Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.08485","last_updated":"2023-12-11T17:46:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-17T17:59:25Z","title":"Visual Instruction Tuning","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-11T08:22:03.403362Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.08485"},"observation_digest":"sha256:79970ac582b4536846c726065cb2381b48d6825964df535453c65607d75f442a","observation_id":"befe83aa-0534-4f38-91e5-e5cae77ade0d","resolution":{"observed_at":"2026-05-11T08:22:03.667111Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.10592","last_updated":"2023-10-02T16:38:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-20T18:25:35Z","title":"MiniGPT-4: Enhancing Vision-Language Understanding with Advanced Large Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-05-10T20:37:01.617345Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.10592"},"observation_digest":"sha256:e7cf6e64cc0ff5abcde49ea11ba4d57b2310a1aa12957af3f9578d70317683a0","observation_id":"fcf60ea2-b0a9-48aa-8ec2-111d3152caed","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.11477","last_updated":"2023-09-27T07:29:44Z","snapshot_observed_at":"2026-08-01T15:58:01.346044Z","submitted_at":"2023-04-22T20:34:03Z","title":"LLM+P: Empowering Large Language Models with Optimal Planning Proficiency","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-05-14T18:36:18.342052Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.11477"},"observation_digest":"sha256:291687d4409c12a76386b410bf833bebe0c879a31d02ffb8f59330be13995cb0","observation_id":"9fe471de-0366-45c8-8ae3-e99f9c53e3ae","resolution":{"observed_at":"2026-05-14T18:36:18.624261Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2304.13734","last_updated":"2023-10-17T09:34:30Z","snapshot_observed_at":"2026-08-01T19:59:13.992395Z","submitted_at":"2023-04-26T02:49:38Z","title":"The Internal State of an LLM Knows When It's Lying","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-16T00:08:36.530560Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2304.13734"},"observation_digest":"sha256:86b551608ee809879aede543b2dd3dba074b7ad9ecf3a80535532ca04f236a93","observation_id":"0eb560bf-716d-4408-8d93-0629dd0cc843","resolution":{"observed_at":"2026-05-16T00:08:36.558135Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-07-06T15:22:55.122322Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"reference_index":113,"source":"arxiv_source","source_observed_at":"2026-05-21T20:50:09.265838Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.02301"},"observation_digest":"sha256:c67c2d71cac162734c11bdd4486ce038f39e272ec04fd831e7756f655e1d80d5","observation_id":"b824ca1b-d691-4ace-9ecb-392aaed5442d","resolution":{"observed_at":"2026-05-21T20:50:09.510583Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.03726","last_updated":"2025-07-28T05:33:36Z","snapshot_observed_at":"2026-07-06T15:23:52.761222Z","submitted_at":"2023-05-05T17:59:46Z","title":"Otter: A Multi-Modal Model with In-Context Instruction Tuning","version":2},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-05-15T02:43:47.775691Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.03726"},"observation_digest":"sha256:51efd1dfdcedb783dcccaca737cfeff0a38a4817ea88cde8f135b0b8cf18f029","observation_id":"7f5b49fb-fed5-412e-8c0b-fcb09c866c1d","resolution":{"observed_at":"2026-05-15T02:43:47.912543Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"reference_index":116,"source":"arxiv_source","source_observed_at":"2026-05-10T23:32:59.517389Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.06161"},"observation_digest":"sha256:ca28590d7e55e869b92eb5355ea97ddffcaec95dcf20c01032b984d7f253d6f7","observation_id":"d83912fc-1da1-442b-b14b-828afdb52f33","resolution":{"observed_at":"2026-05-10T23:33:00.668374Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.06355","last_updated":"2024-01-04T02:06:07Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-10T17:59:04Z","title":"VideoChat: Chat-Centric Video Understanding","version":2},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-05-13T23:30:00.457974Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.06355"},"observation_digest":"sha256:e8f9906badff2a6f547d348a5a1688fb8b90acbb5a41fc9ee337159e0fad88d2","observation_id":"00743eca-d43d-4f66-8b69-91eb324e821b","resolution":{"observed_at":"2026-05-13T23:30:00.739742Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.07895","last_updated":"2024-08-26T02:37:14Z","snapshot_observed_at":"2026-07-06T15:26:46.489500Z","submitted_at":"2023-05-13T11:28:37Z","title":"OCRBench: On the Hidden Mystery of OCR in Large Multimodal Models","version":7},"reference_index":107,"source":"pdf_text","source_observed_at":"2026-05-17T09:55:35.452649Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.07895"},"observation_digest":"sha256:6a0c2070e4b78bf66764b1102685e2c880a755976429b95ff6224b7029299533","observation_id":"0321d925-5020-4498-bf57-8eb2d1a38cd4","resolution":{"observed_at":"2026-05-17T09:55:35.557414Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.10250","last_updated":"2023-05-21T06:20:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T14:40:29Z","title":"MemoryBank: Enhancing Large Language Models with Long-Term Memory","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-16T07:18:09.009478Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.10250"},"observation_digest":"sha256:9ee0f50eaa6e16141fef142abc71b0130c1218ea5f6485cf9c06bb50c7ba6fab","observation_id":"42ca2a48-7b9f-4d47-84fe-7be523dadfb3","resolution":{"observed_at":"2026-05-16T07:18:09.051576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.10415","last_updated":"2024-09-08T01:04:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-17T17:50:16Z","title":"PMC-VQA: Visual Instruction Tuning for Medical Visual Question Answering","version":6},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-05-15T23:08:21.673251Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.10415"},"observation_digest":"sha256:264444c58b8a396797fc72aad577ba236609851700c3d714935ece71966fe3db","observation_id":"012a2552-eee9-4303-84cd-846687718c93","resolution":{"observed_at":"2026-05-15T23:08:21.881875Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.14314","last_updated":"2023-05-23T17:50:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:50:33Z","title":"QLoRA: Efficient Finetuning of Quantized LLMs","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-05-11T13:29:53.345251Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.14314"},"observation_digest":"sha256:525734b18ce9133d831f1b6878105b44e155f8f7e301137fa174369f9b66770a","observation_id":"f9f396a2-7cd6-4fc6-a5e9-f0ce6c9b5aee","resolution":{"observed_at":"2026-05-11T13:29:53.816156Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.15334","last_updated":"2023-05-24T16:48:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-24T16:48:11Z","title":"Gorilla: Large Language Model Connected with Massive APIs","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-11T23:22:16.879418Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.15334"},"observation_digest":"sha256:70bc846c0c440e46a4fe394dac692307452357a6f5a3390bac97aedae4c8b3a2","observation_id":"196911c5-4bfc-4a4c-81dd-64f74b9b81ab","resolution":{"observed_at":"2026-05-11T23:22:16.951888Z","resolver_source":"local_arxiv","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.16264","last_updated":"2025-06-28T00:00:06Z","snapshot_observed_at":"2026-07-06T15:33:27.761070Z","submitted_at":"2023-05-25T17:18:55Z","title":"Scaling Data-Constrained Language Models","version":5},"reference_index":140,"source":"pdf_text","source_observed_at":"2026-05-18T01:35:21.150772Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.16264"},"observation_digest":"sha256:7c9a5cf1f043674c877806280783ec3ad879d1b3991b0dcca82b4ad290bf44d2","observation_id":"df4e93e3-8fb1-49e0-8b9a-af0a543f26e1","resolution":{"observed_at":"2026-05-18T01:35:21.524357Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2305.17493","last_updated":"2024-04-14T05:20:10Z","snapshot_observed_at":"2026-07-06T15:34:21.966171Z","submitted_at":"2023-05-27T15:10:41Z","title":"The Curse of Recursion: Training on Generated Data Makes Models Forget","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-20T14:04:58.271168Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2305.17493"},"observation_digest":"sha256:ab89d78bb1b6680c9cfaab1835b6b9fae890fc1e65746377719dc3461435be90","observation_id":"63bffabe-21b0-4685-860d-892509d8e277","resolution":{"observed_at":"2026-05-20T14:04:58.315231Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2306.01116","last_updated":"2023-06-01T20:03:56Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-01T20:03:56Z","title":"The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-13T20:43:45.770157Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2306.01116"},"observation_digest":"sha256:a177c40059b35c520403877a3591837f48e404be1ff356e9d913bc427021653a","observation_id":"273798f6-6117-48cd-9cce-fd9ed4d51e88","resolution":{"observed_at":"2026-05-13T20:43:45.898343Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2306.08543","last_updated":"2026-01-31T09:16:35Z","snapshot_observed_at":"2026-08-02T20:03:32.798288Z","submitted_at":"2023-06-14T14:44:03Z","title":"MiniLLM: On-Policy Distillation of Large Language Models","version":6},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-12T17:40:27.827493Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2306.08543"},"observation_digest":"sha256:4d43fb68ba6a1c048ffb3a073003246e393132ac99cf7a459610fb19702dbb9e","observation_id":"2dd15333-785b-4d25-a3a0-76fe8751b6ad","resolution":{"observed_at":"2026-05-12T17:40:27.982951Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2306.14048","last_updated":"2023-12-18T19:10:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-24T20:11:14Z","title":"H$_2$O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models","version":3},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-17T18:00:50.053377Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2306.14048"},"observation_digest":"sha256:1b032c2621b26ac953df3d20e36c661df53155894efb39c84f3101a7db321887","observation_id":"e4a8c8c6-f9b3-4021-aeb8-9c1db567286a","resolution":{"observed_at":"2026-05-17T18:00:50.491623Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2307.06435","last_updated":"2024-10-17T01:10:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-07-12T20:01:52Z","title":"A Comprehensive Overview of Large Language Models","version":10},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-05-19T20:28:38.900026Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2307.06435"},"observation_digest":"sha256:d0f58e44c623d017fc63c0d17d15095ab2ef6955dc5adb101758a588d2ead5cd","observation_id":"4b5a40e2-c134-4ef6-923e-eda740d6c207","resolution":{"observed_at":"2026-05-19T20:28:39.326600Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2308.01390","last_updated":"2023-08-07T17:53:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-02T19:10:23Z","title":"OpenFlamingo: An Open-Source Framework for Training Large Autoregressive Vision-Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-14T01:52:01.163900Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2308.01390"},"observation_digest":"sha256:18bb874f45e4675e65dbb5624ce6ee78fefeb18934581b1ad5777a08fd43d324","observation_id":"26cbd2d7-8a40-47d7-9e58-145fce4212f6","resolution":{"observed_at":"2026-05-14T01:52:01.366859Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2308.05374","last_updated":"2024-03-21T00:21:14Z","snapshot_observed_at":"2026-08-02T17:09:20.540788Z","submitted_at":"2023-08-10T06:43:44Z","title":"Trustworthy LLMs: a Survey and Guideline for Evaluating Large Language Models' Alignment","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-05-17T22:30:44.520703Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2308.05374"},"observation_digest":"sha256:14834076b1e153a3bb16c0123f0d77f227de40dda9a35cc1f7b12843b9286e68","observation_id":"20e0c407-28f6-454b-8caf-4fb1cfdb9431","resolution":{"observed_at":"2026-05-17T22:30:44.714012Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2308.10248","last_updated":"2024-10-10T13:20:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-20T12:21:05Z","title":"Steering Language Models With Activation Engineering","version":5},"reference_index":110,"source":"arxiv_source","source_observed_at":"2026-05-11T00:14:14.079351Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2308.10248"},"observation_digest":"sha256:2ce650ee21f66da7810e41aaa7b1b7d6dfbc257831d5da21adafb26136ba4369","observation_id":"1836390f-140f-4f5c-81ab-4e3f5baa3ec8","resolution":{"observed_at":"2026-05-11T00:14:14.916450Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.05653","last_updated":"2023-10-03T02:48:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-11T17:47:22Z","title":"MAmmoTH: Building Math Generalist Models through Hybrid Instruction Tuning","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-17T23:46:39.330438Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.05653"},"observation_digest":"sha256:d6f151eda702dde30ab4209ebb1e67b9aa1a9e8a9408c8605076b76d41b8e2dd","observation_id":"df086d14-8733-4c9e-ab18-a790d0a84d64","resolution":{"observed_at":"2026-05-17T23:46:39.624830Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.06180","last_updated":"2023-09-12T12:50:04Z","snapshot_observed_at":"2026-08-02T09:51:08.145755Z","submitted_at":"2023-09-12T12:50:04Z","title":"Efficient Memory Management for Large Language Model Serving with PagedAttention","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-12T15:03:07.651839Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.06180"},"observation_digest":"sha256:2f2c0d6549fae6fb270b4bce7eb2205989d42a8c18092c2842cb197deb9f66b3","observation_id":"75626fe5-d11e-4f77-8cd3-5785faa1cee0","resolution":{"observed_at":"2026-05-12T15:03:07.806825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.08532","last_updated":"2025-05-01T11:56:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-15T16:50:09Z","title":"EvoPrompt: Connecting LLMs with Evolutionary Algorithms Yields Powerful Prompt Optimizers","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-16T06:11:49.475825Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.08532"},"observation_digest":"sha256:047148006d26e848ffb875ccdf5801e72ae33987851ebc3e82d51552b6b3bca7","observation_id":"77b93b1b-2b74-4911-854f-1fa53b1fa836","resolution":{"observed_at":"2026-05-16T06:11:49.623763Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.10305","last_updated":"2025-04-17T08:34:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-19T04:13:22Z","title":"Baichuan 2: Open Large-scale Language Models","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-24T06:51:02.531751Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.10305"},"observation_digest":"sha256:35e09ef66140f64651dd1c5a8913a31e739582e2304c0579624370c2afd83b90","observation_id":"c7aa98c0-5f95-4d71-a270-4d1c0552cb96","resolution":{"observed_at":"2026-05-24T06:54:03.457227Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2309.16588","last_updated":"2024-04-12T09:38:33Z","snapshot_observed_at":"2026-08-05T00:06:47.268747Z","submitted_at":"2023-09-28T16:45:46Z","title":"Vision Transformers Need Registers","version":2},"reference_index":296,"source":"arxiv_source","source_observed_at":"2026-05-13T09:41:37.937046Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2309.16588"},"observation_digest":"sha256:93b36aea971ee561eca46df991679f7e706ada5257836f952df3f1433d5e00ff","observation_id":"7e2ed029-fd03-4cb4-955d-b769dbe1fc56","resolution":{"observed_at":"2026-05-13T09:41:38.258790Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.01801","last_updated":"2024-10-29T18:26:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T05:17:08Z","title":"Model Tells You What to Discard: Adaptive KV Cache Compression for LLMs","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-17T11:11:21.460613Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.01801"},"observation_digest":"sha256:81f9e41b568b3a1adea8a1a7510556b5bf306c337898c3b94aecd61b0eef8ef3","observation_id":"5a1474a1-e1d7-4b47-a714-11f409942f5a","resolution":{"observed_at":"2026-05-17T11:11:21.644303Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-05-16T07:13:08.867745Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.09478"},"observation_digest":"sha256:e30246f9f1fbe55fe08d59b9894b850ad3aacce55e040d7c6b33058a7562b550","observation_id":"a85ee08a-248b-4e70-9e04-63bf64069a34","resolution":{"observed_at":"2026-05-16T07:13:09.009590Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.11113","last_updated":"2024-09-07T06:30:56Z","snapshot_observed_at":"2026-07-06T16:34:23.428329Z","submitted_at":"2023-10-17T09:53:03Z","title":"Revisiting Sentiment Analysis for Software Engineering in the Era of Large Language Models","version":3},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-05-24T06:12:38.139005Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.11113"},"observation_digest":"sha256:49d973c9642161b4535403e6c75e0fc219c9ac82b84eb33a8ea6623d2936bb38","observation_id":"6ff834b0-7d1c-4fc2-a425-333a803e509a","resolution":{"observed_at":"2026-05-24T06:13:59.954660Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-05-12T14:01:49.854238Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.11441"},"observation_digest":"sha256:1bfb5f89ab1fa2d39392af4e81c788ccfcf333f9a22fedd660357d3cbef5ade9","observation_id":"12e421d9-23c6-484f-a0ac-5062d3218213","resolution":{"observed_at":"2026-05-12T14:01:49.943825Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.11511","last_updated":"2023-10-17T18:18:32Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-17T18:18:32Z","title":"Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection","version":1},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-12T14:15:10.907921Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.11511"},"observation_digest":"sha256:028722b767e84b7edce8193ff095768dbdf0ff0e9402fed7cabf4be9c6fc922e","observation_id":"7cb74263-c1ed-42e2-ad09-14c7a14af2f7","resolution":{"observed_at":"2026-05-12T14:15:11.359841Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2310.16789","last_updated":"2024-03-09T22:26:06Z","snapshot_observed_at":"2026-07-06T16:38:29.188225Z","submitted_at":"2023-10-25T17:21:23Z","title":"Detecting Pretraining Data from Large Language Models","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-17T18:07:24.533329Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2310.16789"},"observation_digest":"sha256:7c12e188bcd41ed3239bdd518324aa40aed6e98a30eb67afcbf6b704178b4009","observation_id":"22ad69ff-de9e-4a3f-ab8c-84717bc5f5a5","resolution":{"observed_at":"2026-05-17T18:07:24.683026Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2311.12871","last_updated":"2024-05-09T17:35:44Z","snapshot_observed_at":"2026-08-02T11:57:50.333488Z","submitted_at":"2023-11-18T01:21:38Z","title":"An Embodied Generalist Agent in 3D World","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-17T14:22:18.606817Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2311.12871"},"observation_digest":"sha256:cdd7fd1741b634de2263787be708be6034085d979687ed43a50104e15e09aee5","observation_id":"596c5f4d-4a2f-4c49-9bbd-ef4c71d4f37c","resolution":{"observed_at":"2026-05-17T14:22:18.663486Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2311.16867","last_updated":"2023-11-29T19:45:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-28T15:12:47Z","title":"The Falcon Series of Open Language Models","version":2},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-16T09:46:09.701440Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2311.16867"},"observation_digest":"sha256:ad0aea017b87e6329a6aa64de51e6cd3c0bff692c31cccea74552b376434eb71","observation_id":"844c0d36-6ac3-4fa7-9116-c8a03a6c7404","resolution":{"observed_at":"2026-05-16T09:46:10.112969Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2401.02385","last_updated":"2024-06-04T02:05:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-04T17:54:59Z","title":"TinyLlama: An Open-Source Small Language Model","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-13T21:09:45.317768Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2401.02385"},"observation_digest":"sha256:2ab1fc5d38de8613aeb14f3b6dd0c259c7459fa5efd4bac9c297735a9ee9714f","observation_id":"774ee626-bc61-4b0b-9ccb-3867c51e9d38","resolution":{"observed_at":"2026-05-13T21:09:45.444656Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2401.10774","last_updated":"2024-06-14T23:32:32Z","snapshot_observed_at":"2026-07-06T17:17:56.276857Z","submitted_at":"2024-01-19T15:48:40Z","title":"Medusa: Simple LLM Inference Acceleration Framework with Multiple Decoding Heads","version":3},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-13T10:36:17.764761Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2401.10774"},"observation_digest":"sha256:dfba864e27be733c3e09014e5a4cdec04469bfffcee1470c61b92c58bf661165","observation_id":"8a93a5c5-5dd9-4847-ae43-80d5adef0bba","resolution":{"observed_at":"2026-05-13T10:36:18.284166Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2401.16420","last_updated":"2024-01-29T18:59:02Z","snapshot_observed_at":"2026-07-06T17:22:03.122430Z","submitted_at":"2024-01-29T18:59:02Z","title":"InternLM-XComposer2: Mastering Free-form Text-Image Composition and Comprehension in Vision-Language Large Model","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-05-17T05:30:27.667126Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2401.16420"},"observation_digest":"sha256:16c389159b883cb1f53a232ded4956a1234a594dc4b35852421a316043fdfdbc","observation_id":"01d3d961-a39d-4144-bb74-6beda18b29d1","resolution":{"observed_at":"2026-05-17T05:30:27.796367Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2402.06196","last_updated":"2025-03-23T14:51:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-09T05:37:09Z","title":"Large Language Models: A Survey","version":3},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-05-11T15:22:54.023279Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2402.06196"},"observation_digest":"sha256:c19e26ce86865af01d53fadde93afd3d1e7991f1b65f354384913a5437322267","observation_id":"687a9e69-9a39-4182-9fd1-6741b04eb4d3","resolution":{"observed_at":"2026-05-11T15:22:55.243949Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.07691","last_updated":"2024-03-14T07:47:08Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T14:34:08Z","title":"ORPO: Monolithic Preference Optimization without Reference Model","version":2},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-16T09:34:04.394588Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.07691"},"observation_digest":"sha256:27e03b7ef67bd6164de5027380494e928374d44643affb39d7a7d22ec22f42db","observation_id":"00165936-c179-4da1-b903-96878ccc4b97","resolution":{"observed_at":"2026-05-16T09:34:04.720077Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.07974","last_updated":"2024-06-06T17:41:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-12T17:58:04Z","title":"LiveCodeBench: Holistic and Contamination Free Evaluation of Large Language Models for Code","version":2},"reference_index":186,"source":"arxiv_source","source_observed_at":"2026-05-10T17:34:42.565806Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.07974"},"observation_digest":"sha256:5c039f625b33c765782811c90cb1206df3ad53579ff2cb7a270da06c59313c5f","observation_id":"e0b12bfc-28f4-495d-9196-b91b950d835a","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"reference_index":131,"source":"pdf_text","source_observed_at":"2026-05-16T04:09:36.019146Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.09611"},"observation_digest":"sha256:b46a895f86517d88444ad865a1e7891bfc790003b6dc1bd5ef66045c5f115109","observation_id":"40cab045-57f1-4738-98c6-fadb2efaa41d","resolution":{"observed_at":"2026-05-16T04:09:36.408532Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.15152","last_updated":"2026-04-08T14:55:27Z","snapshot_observed_at":"2026-08-01T23:31:24.221728Z","submitted_at":"2024-03-22T12:08:16Z","title":"Caption-Matching: A Multimodal Approach for Cross-Domain Image Retrieval","version":3},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-05-24T03:09:06.708434Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.15152"},"observation_digest":"sha256:cd06ae8d38b5ebae23970bce50f1b8474523ac47060fff5c825e10e002e7a0c0","observation_id":"eb4be15c-5221-4559-9bf6-765e402fa9fb","resolution":{"observed_at":"2026-05-24T03:13:48.998115Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.18151","last_updated":"2026-04-22T00:22:39Z","snapshot_observed_at":"2026-08-02T17:41:20.127541Z","submitted_at":"2024-03-26T23:32:29Z","title":"Automated Description Generation of Cytologic Findings for Lung Cytological Images Using a Pretrained Vision Model and Dual Text Decoders: Preliminary Study","version":2},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-05-24T02:42:25.516158Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.18151"},"observation_digest":"sha256:f1f69c3e37359a074c1825d1b171fc0abab6a26a5d647bd5356ad6dac3bbc393","observation_id":"7fee25fd-a038-4e5f-aee4-3460ba255683","resolution":{"observed_at":"2026-05-24T02:43:47.418292Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2403.18814","last_updated":"2024-03-27T17:59:04Z","snapshot_observed_at":"2026-07-31T05:41:28.385099Z","submitted_at":"2024-03-27T17:59:04Z","title":"Mini-Gemini: Mining the Potential of Multi-modality Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-17T07:44:47.355960Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2403.18814"},"observation_digest":"sha256:cc622e6d5317c78bd3088b85493224850a254637a8a997a8bbd74be82d4fafef","observation_id":"e6e3805c-0bb5-4abe-b963-7e4ca6a48ceb","resolution":{"observed_at":"2026-05-17T07:44:47.412650Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2404.02138","last_updated":"2026-04-15T01:27:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-02T17:49:40Z","title":"Topic-Based Watermarks for Large Language Models","version":6},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-24T02:03:15.833131Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2404.02138"},"observation_digest":"sha256:3f84fc2974d88f5100438dba6d91c9053033943893abbb63dd985bb10d4f0a33","observation_id":"c3f77e25-fd0a-41d5-92cc-f38fa55e6b26","resolution":{"observed_at":"2026-05-24T02:03:43.924728Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2404.10981","last_updated":"2024-08-23T00:17:02Z","snapshot_observed_at":"2026-07-06T18:01:18.745347Z","submitted_at":"2024-04-17T01:27:42Z","title":"A Survey on Retrieval-Augmented Text Generation for Large Language Models","version":2},"reference_index":168,"source":"pdf_text","source_observed_at":"2026-05-24T02:15:05.379583Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2404.10981"},"observation_digest":"sha256:bcd924fd8cec8241cb95d22cb06473e4bac326703e95b28ff114d30d84bdfcf9","observation_id":"cce8e37e-730f-4cea-b647-22880aa5769d","resolution":{"observed_at":"2026-05-24T02:15:55.534384Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2404.14294","last_updated":"2024-07-19T04:47:36Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T15:53:08Z","title":"A Survey on Efficient Inference for Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-15T02:39:33.007894Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2404.14294"},"observation_digest":"sha256:cdb487d403452714687a735f788eac7d1918cdea5385f9e0379fa3c6008b01ec","observation_id":"c475200d-ba09-4451-bb1c-7343d915229b","resolution":{"observed_at":"2026-05-15T02:39:33.262256Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2405.14093","last_updated":"2026-05-01T01:50:44Z","snapshot_observed_at":"2026-08-04T06:47:25.827167Z","submitted_at":"2024-05-23T01:43:54Z","title":"A Survey on Vision-Language-Action Models for Embodied AI","version":8},"reference_index":286,"source":"pdf_text","source_observed_at":"2026-05-24T01:25:10.150459Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2405.14093"},"observation_digest":"sha256:db4451fe350e6fc5ecf80a57f9e5e7041d61a86b0c052f998703028cc7d5ed89","observation_id":"d36b0696-0485-42c3-bca0-16607033cd43","resolution":{"observed_at":"2026-05-24T01:25:54.496502Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2406.06525","last_updated":"2024-06-10T17:59:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-10T17:59:52Z","title":"Autoregressive Model Beats Diffusion: Llama for Scalable Image Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-05-11T22:09:16.622717Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2406.06525"},"observation_digest":"sha256:97497ff940f015d1449ad187c0163c3e2120f7754e446b7546f20e6f5896bce5","observation_id":"536aeaf9-7003-4b57-8c62-8151284271b3","resolution":{"observed_at":"2026-05-11T22:09:16.812749Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2406.08334","last_updated":"2026-04-20T05:53:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T15:40:06Z","title":"ProTrain: Efficient LLM Training via Memory-Aware Techniques","version":2},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-05-23T23:48:40.669335Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2406.08334"},"observation_digest":"sha256:f893a05b84f728f8b984ca508cac20a250b99e2cfe92e72d91c658c5eaaa6a08","observation_id":"395dfc0c-ea25-4083-b250-9e4c1df21721","resolution":{"observed_at":"2026-05-23T23:53:39.452820Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2406.12793","last_updated":"2024-07-30T03:58:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-18T16:58:21Z","title":"ChatGLM: A Family of Large Language Models from GLM-130B to GLM-4 All Tools","version":2},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-11T08:08:09.444352Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2406.12793"},"observation_digest":"sha256:bf0d1c6b18e7efd7dd29e85d47516147549dade7e367aec073df83f9cefd110d","observation_id":"f1e5bc3d-1d71-4819-a400-87485dd238ab","resolution":{"observed_at":"2026-05-11T08:08:09.707730Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2408.05086","last_updated":"2026-04-09T04:08:22Z","snapshot_observed_at":"2026-08-04T17:12:16.470795Z","submitted_at":"2024-08-09T14:17:36Z","title":"A systematic framework for generating novel experimental hypotheses from language models","version":3},"reference_index":122,"source":"arxiv_source","source_observed_at":"2026-05-23T21:54:17.835390Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2408.05086"},"observation_digest":"sha256:c9d77ad896606ac2acc140c71a3af2e432b590197d8c71500274c9e27bb889c9","observation_id":"acd584bc-f244-4a67-aa6e-0efbfddab96a","resolution":{"observed_at":"2026-05-23T21:55:50.890598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2409.01704","last_updated":"2024-09-03T08:41:31Z","snapshot_observed_at":"2026-08-01T15:04:20.648996Z","submitted_at":"2024-09-03T08:41:31Z","title":"General OCR Theory: Towards OCR-2.0 via a Unified End-to-end Model","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-05-17T20:50:57.814634Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2409.01704"},"observation_digest":"sha256:abeef469250ecdf4404863691e97c75cb6661cf4d29c165abf5c0b60dc87a9f0","observation_id":"297a21fe-7022-469c-9b71-a0740b0ddfe9","resolution":{"observed_at":"2026-05-17T20:50:57.913525Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2409.18169","last_updated":"2026-04-23T18:48:49Z","snapshot_observed_at":"2026-07-06T19:22:58.341345Z","submitted_at":"2024-09-26T17:55:22Z","title":"Harmful Fine-tuning Attacks and Defenses for Large Language Models: A Survey","version":6},"reference_index":178,"source":"pdf_text","source_observed_at":"2026-05-23T20:58:16.237327Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2409.18169"},"observation_digest":"sha256:6222d9836e322a1d02141716217892bdf2c097558ed4841cb1a09f60c0744afa","observation_id":"179d7e1d-a86c-49e0-852c-fdfbc6e89fe9","resolution":{"observed_at":"2026-05-23T20:58:25.782915Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2410.10781","last_updated":"2025-03-02T14:37:53Z","snapshot_observed_at":"2026-08-02T20:46:05.666977Z","submitted_at":"2024-10-14T17:50:28Z","title":"When Attention Sink Emerges in Language Models: An Empirical View","version":2},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-16T17:41:03.674759Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2410.10781"},"observation_digest":"sha256:700d82eb8c29c83f77787e6d3f128383685269cb5f23e6e3e29dfeab503663d8","observation_id":"137fae06-a188-4af3-a628-49c573bedaa1","resolution":{"observed_at":"2026-05-16T17:41:03.789642Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2410.21316","last_updated":"2026-04-13T06:21:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-26T00:43:59Z","title":"Deep Optimizer States: Towards Scalable Training of Transformer Models Using Interleaved Offloading","version":2},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-05-23T19:40:53.056745Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2410.21316"},"observation_digest":"sha256:308424da5ad05794dc37897c7d504d9e83cb56fd0e5a92079b55349693f67e0a","observation_id":"f81655f2-28ed-479d-ac3a-0496687260f7","resolution":{"observed_at":"2026-05-23T19:43:23.631721Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2411.01141","last_updated":"2026-05-20T04:50:41Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-02T05:10:50Z","title":"Dictionary Insertion Prompting for Multilingual Reasoning on Multilingual Large Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-23T18:03:19.212619Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.01141"},"observation_digest":"sha256:3b25089c9dd8f31889037c51ac617616b2fb7e996b75254767623ae47739dc12","observation_id":"c626e630-9adb-46f4-9b22-4c0e7d306dc8","resolution":{"observed_at":"2026-05-23T18:05:44.676359Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2411.11707","last_updated":"2026-04-23T04:42:47Z","snapshot_observed_at":"2026-07-06T19:52:03.121993Z","submitted_at":"2024-11-18T16:34:58Z","title":"Federated Co-tuning Framework for Large and Small Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-23T17:08:05.240432Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2411.11707"},"observation_digest":"sha256:8b996c6b0971a4c9acde2fe76a989dd5a4f606abf35f55a4272ff81e4dd14bed","observation_id":"9b19c740-c229-45dc-84e3-1e0ccc58d769","resolution":{"observed_at":"2026-05-23T17:08:12.517620Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.00069","last_updated":"2026-04-18T21:44:35Z","snapshot_observed_at":"2026-07-06T19:59:06.645605Z","submitted_at":"2024-11-26T00:56:18Z","title":"Condense, Don't Just Prune: Enhancing Efficiency and Performance in MoE Layer Pruning","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-23T17:10:06.053994Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.00069"},"observation_digest":"sha256:e6b4134ebbe9105f670e46e9154f4f5c95eb13c4cce92a70e2805b7ecedac583","observation_id":"455d5464-fabf-4953-84e9-97f33299eacf","resolution":{"observed_at":"2026-05-23T17:13:13.990072Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.02612","last_updated":"2024-12-03T17:41:24Z","snapshot_observed_at":"2026-08-02T21:27:26.884251Z","submitted_at":"2024-12-03T17:41:24Z","title":"GLM-4-Voice: Towards Intelligent and Human-Like End-to-End Spoken Chatbot","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-16T03:53:47.396742Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.02612"},"observation_digest":"sha256:2acf3038e756e75891a9a20d6db54fa78eff8ebb355b21c95e590af1eea4f46b","observation_id":"f8751651-4312-4aab-aba1-28dbbaf552d9","resolution":{"observed_at":"2026-05-16T03:53:47.556162Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.12686","last_updated":"2026-04-10T04:31:27Z","snapshot_observed_at":"2026-08-02T20:28:53.300850Z","submitted_at":"2024-12-17T09:05:30Z","title":"Exploring Cross-lingual Latent Transplantation: Mutual Opportunities and Open Challenges","version":3},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-05-23T07:05:16.608690Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.12686"},"observation_digest":"sha256:5d9a7a3525c8300f914c0a8c34a2e9b3e692f322ca4baff080ef6c720fa10fc8","observation_id":"0727e02f-00cc-4fa3-83a4-2ce638887558","resolution":{"observed_at":"2026-05-23T07:05:29.051202Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.15176","last_updated":"2026-04-20T11:16:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T18:51:06Z","title":"Rethinking Uncertainty Estimation in LLMs: A Principled Single-Sequence Measure","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-05-23T06:22:25.496269Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.15176"},"observation_digest":"sha256:c905f46dff6213c081a01478e87f1a6c3d8cd08e1bf89784cedf0ea41902b566","observation_id":"9ef3ed7c-717e-40a7-a1f4-19ca56bd1131","resolution":{"observed_at":"2026-05-23T06:22:38.088588Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2412.21187","last_updated":"2025-02-01T07:57:37Z","snapshot_observed_at":"2026-08-01T16:43:44.704797Z","submitted_at":"2024-12-30T18:55:12Z","title":"Do NOT Think That Much for 2+3=? On the Overthinking of o1-Like LLMs","version":2},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-13T15:51:29.022336Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2412.21187"},"observation_digest":"sha256:af852b211296524fc9922e049dab7ea45044a1bf9da2e695f8ed4430e4cfb946","observation_id":"0ff8f2dc-c5b6-4e7f-87be-69bdf58cabf3","resolution":{"observed_at":"2026-05-13T15:51:29.308740Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2502.04416","last_updated":"2026-04-23T00:51:26Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-02-06T14:05:30Z","title":"Analytical FFN-to-MoE Restructuring via Activation Pattern Analysis","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-23T04:08:29.089438Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2502.04416"},"observation_digest":"sha256:6e967d20bd7b447b2ede990b46a1ec4643bdb44242805ef2eb0671b7ca2edd44","observation_id":"889323f4-af57-4ac6-8627-739847fd9157","resolution":{"observed_at":"2026-05-23T04:12:31.047861Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2504.08528","last_updated":"2026-04-07T06:11:20Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-04-11T13:40:53Z","title":"On The Landscape of Spoken Language Models: A Comprehensive Survey","version":2},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-05-22T20:44:57.476464Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.08528"},"observation_digest":"sha256:738202d9059ee013b269f817e7ceedc2d1f9aa35360eb55a71e567f8ce078bdf","observation_id":"b396a770-205e-43cc-b664-156b99cfa8ff","resolution":{"observed_at":"2026-05-22T20:45:08.040545Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2504.10013","last_updated":"2026-05-07T10:54:03Z","snapshot_observed_at":"2026-07-06T21:08:57.447867Z","submitted_at":"2025-04-14T09:17:47Z","title":"Training LLMs on HPC Systems: Best Practices from the OpenGPT-X Project","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-05-22T21:04:11.859563Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.10013"},"observation_digest":"sha256:cc95d618064b02d2431d9e2362d243b87f3a1b0ac9e10ef55141a30170010f7f","observation_id":"a654ffc2-83de-4765-9422-7af6af9f39cd","resolution":{"observed_at":"2026-05-22T21:05:09.648773Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2504.17333","last_updated":"2025-04-24T07:52:02Z","snapshot_observed_at":"2026-07-06T21:14:04.815568Z","submitted_at":"2025-04-24T07:52:02Z","title":"Fine-Grained Fusion: The Missing Piece in Area-Efficient State Space Model Acceleration","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-05-22T19:11:08.841835Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2504.17333"},"observation_digest":"sha256:674828f08c1e73560630cf7111c64069d7b37dc2bd878f7d924420a6d4aa8ce7","observation_id":"7001d17d-68b0-4109-aa20-26d4503f4e90","resolution":{"observed_at":"2026-05-22T19:11:57.964867Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2505.10465","last_updated":"2025-11-29T21:39:27Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-15T16:18:13Z","title":"Superposition Yields Robust Neural Scaling","version":4},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-05-22T14:38:44.789822Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.10465"},"observation_digest":"sha256:b6c139a8f6d518e22f4ac55ea8f908c8a02a7730b3c57ac78b3528f79f648e0b","observation_id":"5a2d446f-5412-400c-b669-4a15115c5055","resolution":{"observed_at":"2026-05-10T20:53:19.162556Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2505.13893","last_updated":"2026-05-22T12:07:36Z","snapshot_observed_at":"2026-08-01T15:46:16.830839Z","submitted_at":"2025-05-20T03:55:35Z","title":"InfiGFusion: Graph-on-Logits Distillation via Efficient Gromov-Wasserstein for Model Fusion","version":2},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-05-25T08:41:52.131759Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.13893"},"observation_digest":"sha256:a5207db057e8120aba56d8c411e18d5a3a5e1084d89129b7e7d3404660885c1f","observation_id":"857df1c5-f82c-4956-87a6-47e677bc1c09","resolution":{"observed_at":"2026-05-25T08:45:32.870751Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2505.14412","last_updated":"2026-04-19T14:17:44Z","snapshot_observed_at":"2026-07-06T21:27:08.958780Z","submitted_at":"2025-05-20T14:26:19Z","title":"PRL: Prompts from Reinforcement Learning","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-22T14:25:22.002977Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.14412"},"observation_digest":"sha256:09dc51b3827b23a67371a2136eacd5d69e1813893c2eabc026ed7e40dc574b66","observation_id":"23406c06-b14a-49db-a4ce-414a166e808b","resolution":{"observed_at":"2026-05-22T14:26:40.415089Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2505.15323","last_updated":"2026-04-03T14:23:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-21T09:58:38Z","title":"Improving LLM First-Token Predictions in Multiple-Choice Question Answering via Output Prefilling","version":2},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-05-22T14:21:18.355360Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.15323"},"observation_digest":"sha256:baff6e962660857df9088459a7c39a125e318efd07534a298eecb405fa82e14c","observation_id":"88a40011-9419-450a-b58e-5cd69476c782","resolution":{"observed_at":"2026-05-22T14:21:39.655234Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2505.22811","last_updated":"2026-04-21T08:01:39Z","snapshot_observed_at":"2026-08-05T01:41:20.121334Z","submitted_at":"2025-05-28T19:40:34Z","title":"Highly Efficient and Effective LLMs with Multi-Boolean Architectures","version":5},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-11T11:50:26.030339Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2505.22811"},"observation_digest":"sha256:f7441375385ad578427d4b62f26296ce4b79b34ce071bc2774ab4b493d9691de","observation_id":"05cc044d-f60f-4ca0-aa60-8a0882fdc86f","resolution":{"observed_at":"2026-05-19T12:42:18.020961Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"cited_work":{"arxiv_id":"2205.01068","doi":"10.48550/arxiv.2205.01068","metadata_source":"pith","pith_arxiv_id":"2205.01068","snapshot_observed_at":"2026-07-11T03:37:45.880117Z","title":"OPT: Open Pre-trained Transformer Language Models","venue":"cs.CL","work_id":"d7ff3b21-1fff-4cf4-952a-4714e3ef2307","year":2022},"citing_paper":{"arxiv_id":"2506.13727","last_updated":"2026-05-07T16:37:45Z","snapshot_observed_at":"2026-07-06T21:43:03.415527Z","submitted_at":"2025-06-16T17:38:36Z","title":"Attribution-Guided Pruning for Insight and Control: Circuit Discovery and Targeted Correction in Small-scale LLMs","version":3},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-05-19T08:52:45.818050Z"},"links":{"cited_paper":"/paper/2205.01068","citing_paper":"/paper/2506.13727"},"observation_digest":"sha256:b60830e24b44557a283d9b2ded1fef0c0d69af9368c4e6fc55add6fc93ad1999","observation_id":"21218a44-90ad-4a60-b962-f3eb9dd7f140","resolution":{"observed_at":"2026-05-19T08:53:04.124019Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-25T10:53:17.026227+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2205.01068/citation-record","integrity":"/paper/2205.01068/integrity","json":"/paper/2205.01068/citation-record.json","paper":"/paper/2205.01068"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2106.03193","last_updated":"2021-06-06T17:58:12Z","snapshot_observed_at":"2026-08-01T11:21:28.445632Z","submitted_at":"2021-06-06T17:58:12Z","title":"The FLORES-101 Evaluation Benchmark for Low-Resource and Multilingual Machine Translation","version":1},"cited_work":{"arxiv_id":"2106.03193","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2106.03193","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"a8f99012-fb3a-463a-9161-3ecabb9042fd","year":2021},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/2106.03193","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e2d618759dc18898d09c2d16f1e7f0a68033d06f5e55d738f38eb29308b04448","observation_id":"6b9edbe9-edb5-4269-acd2-ab8ff3f8cf86","resolution":{"observed_at":"2026-05-10T20:53:17.666664Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6399","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-27T06:30:37.808511Z","title":"Proceedings of the AAAI Conference on Artificial Intelligence , author=","venue":null,"work_id":"a80a62e7-1fb6-4805-a09c-3447c2c1145b","year":2020},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:49abad57b16fdd336e6b880624b7cda95eadf71c5c53197150ea044be1c8de3d","observation_id":"f476fec7-f32e-4980-a5fe-7dbc1dce860d","resolution":{"observed_at":"2026-05-10T20:53:17.050348Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"crossref_status_cache"},{"observed_at":"2026-05-20T23:52:35.422292+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v34i05.6239","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T22:17:24.877495Z","title":"PIQA: Reasoning about physical commonsense in natural language","venue":null,"work_id":"d1a9f293-b596-42e3-b48c-112b9f9a06df","year":2020},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:4f0160f3c630f81e91e2b73452c7f8ac955b750e3e4bc7a997da9bc1852e82d5","observation_id":"4c3ab19d-66b1-4e9e-ad1b-c680daf7130d","resolution":{"observed_at":"2026-05-10T20:53:17.205119Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-08-01T09:08:05.075041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1805.12471","last_updated":"2019-10-01T18:41:05Z","snapshot_observed_at":"2026-07-06T06:42:15.167440Z","submitted_at":"2018-05-31T13:52:06Z","title":"Neural Network Acceptability Judgments","version":3},"cited_work":{"arxiv_id":"1805.12471","doi":null,"metadata_source":"pith","pith_arxiv_id":"1805.12471","snapshot_observed_at":"2026-07-09T21:16:34.237758Z","title":"Neural Network Ac- ceptability Judgments","venue":"cs.CL","work_id":"ee6536e2-986a-4e85-877b-cd6cf6b9219e","year":2018},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1805.12471","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:0d99287a19db168d5a1d517337e40fa8100a2735039b82fcfd244785f6e55825","observation_id":"702c6908-308b-40e4-8b73-9b63c904e4ec","resolution":{"observed_at":"2026-05-10T20:53:17.222272Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Biochimica et Biophysica Acta (BBA)-Protein Structure , volume=","venue":null,"work_id":"41f4e658-9007-4c08-8088-398e658e9daf","year":1975},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1ca26283fe54945c66ee67b92530503d3a2e05eafbaaaa855e3ab5e549354da5","observation_id":"b7a291d1-d524-495e-b29b-ebb0d5bba61d","resolution":{"observed_at":"2026-05-16T01:22:04.098425Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c0d0b302-b8bc-4a2f-ab09-eb62b5b90553","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d3fc879253f105258558cd1f3b776ec651972196f61c3fc1a87042223919129c","observation_id":"5fd6093f-0867-48a9-9cb8-22f0de17cb43","resolution":{"observed_at":"2026-05-10T20:53:18.151891Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1910.09700","last_updated":"2019-11-04T20:37:33Z","snapshot_observed_at":"2026-07-06T08:31:12.309726Z","submitted_at":"2019-10-21T23:57:32Z","title":"Quantifying the Carbon Emissions of Machine Learning","version":2},"cited_work":{"arxiv_id":"1910.09700","doi":"10.48550/arxiv.1910.09700","metadata_source":"pith","pith_arxiv_id":"1910.09700","snapshot_observed_at":"2026-07-10T16:47:24.400411Z","title":"Quantifying the Carbon Emissions of Machine Learning","venue":"cs.CY","work_id":"7bc98d11-b344-40f2-b27f-2e08a08d1b95","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1910.09700","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:5e72c239bbbd31b7ead9afe30a339d889ab79b180243e3143631ebb98347c6d3","observation_id":"b1d22c11-eaec-4748-a655-0729f77e6da0","resolution":{"observed_at":"2026-05-15T05:52:44.534862Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2003.11942","last_updated":"2021-01-06T06:59:07Z","snapshot_observed_at":"2026-07-06T09:07:34.124249Z","submitted_at":"2020-03-26T14:34:09Z","title":"Towards Backward-Compatible Representation Learning","version":3},"cited_work":{"arxiv_id":"2003.11942","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2003.11942","snapshot_observed_at":"2026-06-28T22:42:47.005584Z","title":"arXiv preprint arXiv:2003.11942 , year=","venue":null,"work_id":"021797b3-d33d-4b83-b172-5baf080ca2a1","year":2003},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/2003.11942","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1c15c9ff432514ba12819fa9501a93f19b1514fe8321f0afc0af92d9b242068f","observation_id":"a47057d7-a166-4d3d-a3b4-b98953f8a720","resolution":{"observed_at":"2026-05-10T20:53:17.244274Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2020 , eprint=","venue":null,"work_id":"ef3512b4-67b5-4436-9ff1-6602966278c1","year":2020},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:acdb9778693d5db1218a8c903ed37788137e426ca06b8218c03983f7fc9dadfb","observation_id":"74d34b8d-0e9a-40a3-8b25-b26bffc0ee9f","resolution":{"observed_at":"2026-05-16T01:22:04.280299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T23:11:31.525535Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"f7101c0a-5c39-4c12-b861-e59c16d6b22b","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c8c912b03ebcb4c6543daac964f6ee6c1041fee50676460429b42d17df29f45f","observation_id":"53144cec-cbda-4e2d-bf4a-41831cc771e4","resolution":{"observed_at":"2026-05-10T20:53:19.121306Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05950","last_updated":"2019-08-09T15:51:47Z","snapshot_observed_at":"2026-07-06T07:53:03.268985Z","submitted_at":"2019-05-15T05:47:23Z","title":"BERT Rediscovers the Classical NLP Pipeline","version":2},"cited_work":{"arxiv_id":"1905.05950","doi":"10.48550/arxiv.1905.05950","metadata_source":"arxiv_reference","pith_arxiv_id":"1905.05950","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"arXiv preprint arXiv:1905.05950 , year=","venue":null,"work_id":"47ec8f99-dad5-484e-bf9c-6fd2871df72b","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1905.05950","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:85e69ab19505017b51385b8d2c080a40daddba1507207b8d6a6d903b88fc93c6","observation_id":"d125e125-c5ab-407b-90bd-ad0f01c11c74","resolution":{"observed_at":"2026-05-10T20:53:17.249529Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"47fc64d6-a606-47c1-ab5d-b061e8b531d7","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:f3a3300ca50c2fc2766cfba0e5bfd59f39f71a55da1eb7fa4e5e33757c2e0294","observation_id":"2f954e76-01ee-4dcc-8b20-284c363586a2","resolution":{"observed_at":"2026-05-10T20:53:18.582250Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics , pages=","venue":null,"work_id":"058abfc5-fbd6-407c-a6a9-2a5465a774d0","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:f86c742b8857ab13dcee3ed83f5d1044685395ba12703581e11e465439d2b810","observation_id":"2e6aded3-08ec-4dcb-a9a1-de52dccad984","resolution":{"observed_at":"2026-05-10T20:53:18.159309Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1907.04829","last_updated":"2019-07-10T17:14:47Z","snapshot_observed_at":"2026-08-01T15:42:13.117374Z","submitted_at":"2019-07-10T17:14:47Z","title":"BAM! Born-Again Multi-Task Networks for Natural Language Understanding","version":1},"cited_work":{"arxiv_id":"1907.04829","doi":null,"metadata_source":"pith","pith_arxiv_id":"1907.04829","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"BAM! Born-Again Multi-Task Networks for Natural Language Understanding","venue":"cs.CL","work_id":"7a93b3b5-995f-434e-bb41-0fb424f4c911","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1907.04829","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:0d4d6ea68d5fde8f16e0c2359f83cbaf26c95e6b4108dde07c90e27a15e6bd9e","observation_id":"0b740412-011e-436c-8959-27575ffc5a39","resolution":{"observed_at":"2026-05-10T20:53:17.259331Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine learning , volume=","venue":null,"work_id":"1b4b06dc-0691-4bbe-afd6-329f6c4f6c05","year":1997},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:710756ba7471416c6d0ee28fbeacc310654a17da53ff6b45c98bc75846bc8c36","observation_id":"4bc37671-2b5f-4289-b791-561082d6a5cd","resolution":{"observed_at":"2026-05-16T01:22:04.060596Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.05098","last_updated":"2017-06-15T21:38:12Z","snapshot_observed_at":"2026-08-04T14:30:44.904839Z","submitted_at":"2017-06-15T21:38:12Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","version":1},"cited_work":{"arxiv_id":"1706.05098","doi":"10.48550/arxiv.1706.05098","metadata_source":"pith","pith_arxiv_id":"1706.05098","snapshot_observed_at":"2026-07-10T08:47:01.975964Z","title":"An Overview of Multi-Task Learning in Deep Neural Networks","venue":"cs.LG","work_id":"2c849184-06ce-40df-8143-ec29eb925f39","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1706.05098","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:8fcf519e913754fa118feb0e71af64f1b446e5287da62e45fce0d240e8d4083f","observation_id":"4253bd46-3de6-4afa-8d6b-d9ab25d1d41f","resolution":{"observed_at":"2026-05-13T09:50:25.566913Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-11T15:50:59.119295+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 42nd annual meeting on Association for Computational Linguistics , pages=","venue":null,"work_id":"2be702c4-14a6-47c3-83cf-d808a7333dbb","year":2004},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:6182fa6393e8ba91c843a522a01760e3811eb9d54400673d2294a9f76f6ffd11","observation_id":"293f1689-b969-4dfd-9704-437e011449a0","resolution":{"observed_at":"2026-05-16T01:22:04.079007Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the Fifth International Workshop on Natural Language Processing for Social Media , pages=","venue":null,"work_id":"6c1e8325-adc1-48ff-a9b8-8fd311e36526","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:a05fe8a5a4aa645c0175b121720a2da2439ef7a0508a5afc033944ab517fa7df","observation_id":"48a4deb2-4d60-4e32-83e9-2d440fdb3c55","resolution":{"observed_at":"2026-05-16T01:22:04.215177Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1503.02531","last_updated":"2015-03-09T15:44:49Z","snapshot_observed_at":"2026-07-06T04:11:24.157003Z","submitted_at":"2015-03-09T15:44:49Z","title":"Distilling the Knowledge in a Neural Network","version":1},"cited_work":{"arxiv_id":"1503.02531","doi":"10.1109/cvpr52733.2024.01515","metadata_source":"pith","pith_arxiv_id":"1503.02531","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Distilling the Knowledge in a Neural Network","venue":"stat.ML","work_id":"d927ab1f-17b8-4002-9d09-c3d55764fbad","year":2015},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1503.02531","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:055ab295d5b202f46c8d3040b9f3d9f338ade571ac596db19fe7b075f4f4789b","observation_id":"7ff469da-b9d8-46f8-8573-74254568e58d","resolution":{"observed_at":"2026-05-10T20:53:17.267793Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"178e1332-82a8-479d-bbdd-d3e8384f1753","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:79844e4df38e3880dfbb2af71107e692d1b4b0efc6bf0818aa8f965b531ec29b","observation_id":"a842ed29-a7b5-43dd-bc82-c24dac0c2db3","resolution":{"observed_at":"2026-05-16T01:22:03.912035Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 13th International Workshop on Semantic Evaluation , pages=","venue":null,"work_id":"7b8512ce-f685-414b-a794-b430809b01e3","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e680b269bbf618c2e58a0254c91c7afbfbebf26bf03e051a9f82fc3486ad884c","observation_id":"a7cbf767-0f7f-44ce-9ec4-67a4f3222638","resolution":{"observed_at":"2026-05-10T20:53:19.136940Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1d8b6dcd-a415-4600-88d5-66273f4f98c5","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d3b62d7cb7a4db4544de59a2ca6c1262035478f338b23f0e41733fa784510c40","observation_id":"ab891833-8128-4599-ba3a-a0bfcdf070f4","resolution":{"observed_at":"2026-05-10T20:53:19.129518Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1806.08730","last_updated":"2018-06-20T16:39:26Z","snapshot_observed_at":"2026-07-06T06:46:18.285019Z","submitted_at":"2018-06-20T16:39:26Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","version":1},"cited_work":{"arxiv_id":"1806.08730","doi":"10.2466/pr0.1957.3.3.635","metadata_source":"pith","pith_arxiv_id":"1806.08730","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"The Natural Language Decathlon: Multitask Learning as Question Answering","venue":"cs.CL","work_id":"75b95963-bb63-4588-816d-17e4bf36092e","year":2018},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1806.08730","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:64f8ea71b2722965a3772c5b6657d48070a6edbfccb72dd47756ff69be70f753","observation_id":"b56b1ea5-5eb9-4b6a-9e21-e777d46451a8","resolution":{"observed_at":"2026-05-10T20:53:17.285981Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 25th international conference on Machine learning , pages=","venue":null,"work_id":"6b6a811d-af48-453c-bae9-44f928978e64","year":2008},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:f893609abd2858d2cec4b97df81a75f19c0af58ad9eef5176c885460016f61d8","observation_id":"ac9bcc3c-0460-4520-84f8-86a662b23146","resolution":{"observed_at":"2026-05-10T20:53:18.912401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2015 Conference on Empirical Methods in Natural Language Processing , pages=","venue":null,"work_id":"7e7101a2-9393-4bc3-9ab8-794169c9ede9","year":2015},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e7df3884384fe5b6bcf782dc8ccf917ebc29031a01cedc88f648d365c196c4e6","observation_id":"fa844b7d-c6ab-4abd-9cfd-8c5bc1a41530","resolution":{"observed_at":"2026-05-10T20:53:18.176016Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the conference on empirical methods in natural language processing , pages=","venue":null,"work_id":"c2c744e5-a6cb-4dd3-9c9f-5a6a1ddf560d","year":2008},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:6047b27c7c65a02f2b5f85461ef87bb7944b42f8bf07d3bd3c67caedba782aa2","observation_id":"14456947-3386-4ac6-8ac3-f960a5366d35","resolution":{"observed_at":"2026-05-10T20:53:18.128083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weld and Luke Zettlemoyer and Omer Levy , year=","venue":null,"work_id":"f17b598a-7372-423c-a700-deb6e4e7d8ee","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e2049326c80dac55aa95241e3e06588b1f945b48a9b6c9822d24a276949598dc","observation_id":"54abbf24-fab5-4d41-b27e-6073e205979d","resolution":{"observed_at":"2026-05-10T20:53:18.125347Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1155ce84-964f-4fec-b33e-1eaa003620a5","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:89e957223f585abf7aadf847d39aa5a366a9cefe38a7bd0c8679bca1649e9d9a","observation_id":"197ce313-cf37-48e0-9e6a-0dc74d53ee84","resolution":{"observed_at":"2026-05-10T20:53:18.123052Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"54b86760-dbd4-49ab-a5a0-d69880cc3d44","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:01d6a9937ff8f8f8f8e9163de097a9bbc1d5adba166e42fca7fdef3e02cc29cc","observation_id":"4fcb6571-241a-470f-88ad-27e111b4460b","resolution":{"observed_at":"2026-05-10T20:53:18.120680Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"e583a983-8ea6-4235-a814-f485b08a2fb5","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:750651665af182ed067ba5d8b0cf26a110dc277f268cd84fc54ab839188db0bf","observation_id":"f688a72a-8da8-4e94-99b7-8bdeb22c9ea5","resolution":{"observed_at":"2026-05-10T20:53:18.002118Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , pages=","venue":null,"work_id":"ff39c0c4-911e-454c-b048-f8253ab3b5df","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:49681b0488e4be5a24da4d7b86c3b5ed2255a9a529d695bffcf1c10d0859c860","observation_id":"929ba12e-3f09-46a5-a589-29d0788d0ee5","resolution":{"observed_at":"2026-05-16T01:22:04.142844Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/n16-1162","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Distributed Representations of Sentences from Unlabelled Data","venue":null,"work_id":"26af5314-13d7-47c3-8101-381216f64101","year":2016},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d4bc01fee1d1c9f3d8096108945b8e99593a4c5b1801e63849fb2772a99897e1","observation_id":"486d656c-b050-4d52-80f0-8594de62eb7e","resolution":{"observed_at":"2026-05-10T20:53:17.126162Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Supervised Learning of Universal Sentence Representations from Natural Language Inference Data , booktitle =","venue":null,"work_id":"2d1aa1cf-8782-4354-962f-b253138460fa","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:097f9226720bf709da0ef71f7da699d4c11e492688200f2b6b66314ec3948d00","observation_id":"b04ba3e3-a35b-4b78-8baf-64322918f017","resolution":{"observed_at":"2026-05-16T01:22:03.965936Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.05987","last_updated":"2019-06-11T13:13:46Z","snapshot_observed_at":"2026-07-06T07:39:16.334016Z","submitted_at":"2019-03-14T13:32:31Z","title":"To Tune or Not to Tune? Adapting Pretrained Representations to Diverse Tasks","version":2},"cited_work":{"arxiv_id":"1903.05987","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.05987","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"To Tune or Not to Tune? Adapting Pretrained Representations to Diverse Tasks","venue":"cs.CL","work_id":"05c46e5f-48a5-43ca-b345-39ab07e3b06a","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1903.05987","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c647ad3b3f66872b4835f0decd0e43e0d96b5c20e024c1bd308d244dde305e44","observation_id":"0df35c73-8071-42ed-b6df-a2ac9302b55c","resolution":{"observed_at":"2026-05-10T20:53:17.293354Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.03197","last_updated":"2019-10-15T11:25:06Z","snapshot_observed_at":"2026-08-04T18:31:05.714409Z","submitted_at":"2019-05-08T16:33:51Z","title":"Unified Language Model Pre-training for Natural Language Understanding and Generation","version":3},"cited_work":{"arxiv_id":"1905.03197","doi":null,"metadata_source":"pith","pith_arxiv_id":"1905.03197","snapshot_observed_at":"2026-07-10T20:47:34.544572Z","title":"Uniﬁed language model pre- training for natural language understanding and gen- eration","venue":"cs.CL","work_id":"84b9192c-f13f-4ccb-bf93-71f6b33d9b8e","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1905.03197","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:4d6fe6cf6a43eb502e959d66f98c7a42adfc329a3cd92b74a434884630303d52","observation_id":"00b68de8-8bd3-4489-aacb-0495a2640d14","resolution":{"observed_at":"2026-05-10T20:53:17.299739Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0ff22c14-3861-4943-b68a-2a90ca6688b3","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:ae4305956f87076b6a4f5f50133c9da8d30faa10b05acf023edbe1e5e10d309d","observation_id":"eb37bba3-bffd-4412-b8bd-cf8bcf72cdb1","resolution":{"observed_at":"2026-05-16T01:22:03.971084Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"952aa37b-1daa-48fa-b16a-0a7adc2eff9f","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:0e68f1ea6e222fbd91382a58d45a33795dd2e64c016d15d2db3e503b4323956a","observation_id":"e8b3c063-72a4-4071-9e7a-15772668f186","resolution":{"observed_at":"2026-05-16T01:22:03.932282Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"10a7a1fb-6ec6-4cc2-a2ed-6e33e133573b","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:317f92e1703ce384168febb176cc402f6e97e80325f8982dc33199c48feebe11","observation_id":"7d309032-9c7c-47da-b9c2-51229920f398","resolution":{"observed_at":"2026-05-16T01:22:03.929078Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.08237","last_updated":"2020-01-02T12:48:08Z","snapshot_observed_at":"2026-07-31T22:49:43.034741Z","submitted_at":"2019-06-19T17:35:48Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","version":2},"cited_work":{"arxiv_id":"1906.08237","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.08237","snapshot_observed_at":"2026-07-04T15:59:56.634362Z","title":"XLNet: Generalized Autoregressive Pretraining for Language Understanding","venue":"cs.CL","work_id":"cc2a714a-4036-4500-8361-52cc81c24a4c","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1906.08237","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1714fd904aa7842e3b090b7f7c8578055875135548c8b2c41cd469fc28ca2c66","observation_id":"b060ed01-d03b-4c20-9a53-6dffba4ba304","resolution":{"observed_at":"2026-05-18T01:29:27.629409Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1903.07785","last_updated":"2019-03-19T01:19:06Z","snapshot_observed_at":"2026-07-06T07:40:09.287257Z","submitted_at":"2019-03-19T01:19:06Z","title":"Cloze-driven Pretraining of Self-attention Networks","version":1},"cited_work":{"arxiv_id":"1903.07785","doi":null,"metadata_source":"pith","pith_arxiv_id":"1903.07785","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Cloze-driven Pretraining of Self-attention Networks","venue":"cs.CL","work_id":"bfe64b17-f035-49cc-a296-5a20504947f4","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1903.07785","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:5435dc1f4bdfc15c9192b1de479a688e20906330b5271683d7d3809c916445c5","observation_id":"416039c7-5263-449b-a372-b60b61a67231","resolution":{"observed_at":"2026-05-10T20:53:17.314683Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"7c6215c7-3b09-4f13-915b-a1d00d598269","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:0f1c565ca86697da5642e10862740262ea1cc93d8db2a81ad361cdce7126f01f","observation_id":"b20bdc6d-aba5-49dc-b17e-9d473e908cf0","resolution":{"observed_at":"2026-05-16T01:22:04.303953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.10509","last_updated":"2019-04-23T19:29:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-04-23T19:29:47Z","title":"Generating Long Sequences with Sparse Transformers","version":1},"cited_work":{"arxiv_id":"1904.10509","doi":"10.48550/arxiv.1904.10509","metadata_source":"pith","pith_arxiv_id":"1904.10509","snapshot_observed_at":"2026-07-11T03:27:46.891605Z","title":"Generating Long Sequences with Sparse Transformers","venue":"cs.LG","work_id":"c5b81688-45ee-4a9a-b095-e6290f45cb6c","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1904.10509","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:76d9817e784a6068652912efd6d52a27174f9821107547eb77c64541df6c6013","observation_id":"87aa8afe-33f0-44d4-862e-6954cc7dc7aa","resolution":{"observed_at":"2026-05-10T20:53:17.318127Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-12T21:49:59.71041+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T22:57:43.317447Z","title":null,"venue":null,"work_id":"476eb346-032d-4461-9a15-12687b53027b","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:157fdf0120f6a08f97057c5010d5b3861a02ebcc2418a0730ef743e43cc1e2db","observation_id":"37c6a7ba-da3c-448b-adad-861e544653d5","resolution":{"observed_at":"2026-05-16T01:22:04.284843Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c50724fa-34ca-405e-a976-905e21c62112","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:5d284b8d2bb6e72f5c3f09db55b89221bc240f3d6b7399abba13eec71c76c6bf","observation_id":"d70b9602-7661-42d4-8a39-0d99629556db","resolution":{"observed_at":"2026-05-16T01:22:04.296038Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.00962","last_updated":"2020-01-03T06:53:00Z","snapshot_observed_at":"2026-07-06T07:43:06.427641Z","submitted_at":"2019-04-01T16:53:35Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","version":5},"cited_work":{"arxiv_id":"1904.00962","doi":"10.48550/arxiv.1904.00962","metadata_source":"pith","pith_arxiv_id":"1904.00962","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Large Batch Optimization for Deep Learning: Training BERT in 76 minutes","venue":"cs.LG","work_id":"206d2a89-691e-4467-8958-5630dacf4765","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1904.00962","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:43c2e3666fae91c9141fba6723302ceaaac25b985fcc0d7b935101aeb416194b","observation_id":"2c18b72b-d3d6-4252-b37b-17e33d7951b9","resolution":{"observed_at":"2026-05-21T21:39:00.104164Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-16T20:21:35.755083+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1404.5997","last_updated":"2014-04-26T23:10:51Z","snapshot_observed_at":"2026-08-03T21:57:53.090760Z","submitted_at":"2014-04-23T22:37:56Z","title":"One weird trick for parallelizing convolutional neural networks","version":2},"cited_work":{"arxiv_id":"1404.5997","doi":null,"metadata_source":"pith","pith_arxiv_id":"1404.5997","snapshot_observed_at":"2026-06-29T13:33:27.609259Z","title":"One weird trick for parallelizing convolutional neural networks","venue":"cs.NE","work_id":"ad32a219-5e6c-4d6b-999b-487749b8c9c3","year":2014},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1404.5997","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:cce245d42bc4fcc0cd7b22ac43744abf19f5d43f0715dbde81b2cde49b71fcff","observation_id":"5b36e122-ea84-4279-a5a3-734943e3b631","resolution":{"observed_at":"2026-05-10T20:53:17.334492Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-10T04:46:46.760109Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"c41c2b6d-2808-4a83-9537-f2d5bf48bc34","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:b0c9bb877ae06ff5f4930f9dbfb26a43df747538b61ffd6d58dce930317984ac","observation_id":"4a161257-77b1-4d2c-92cb-c04a4eab1086","resolution":{"observed_at":"2026-05-16T01:22:04.020013Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"05bcd53b-32d6-4f92-b4ad-4e8720d47d24","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c4fde535b49eb5a271432b60d09c40ec62c9c7929c2417d650587337c26d4370","observation_id":"ec5be413-29c7-4b21-844e-38d2edcf43c5","resolution":{"observed_at":"2026-05-16T01:22:04.033308Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ffaf1cd3-b39c-4c00-9529-ffc11df80972","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:27b7138ae1a0fb2ccf77332a177f65d3b4a95d7091081c2b8a4580cc261bcfad","observation_id":"371ff19c-9c5b-4553-8355-dea09ff40e97","resolution":{"observed_at":"2026-05-16T01:22:03.948510Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , booktitle =","venue":null,"work_id":"1b90f336-8a6b-4014-8aae-6b9d5870f808","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:a833aa2131c9eb7852f147d4e688b9b28706862707edaa0752c373ba73c7663f","observation_id":"70ff4d00-d6c6-48f8-9bf1-1576b5b0de66","resolution":{"observed_at":"2026-05-16T01:22:04.269010Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.12616","last_updated":"2020-12-11T16:17:17Z","snapshot_observed_at":"2026-07-06T07:56:30.864880Z","submitted_at":"2019-05-29T17:58:52Z","title":"Defending Against Neural Fake News","version":3},"cited_work":{"arxiv_id":"1905.12616","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.12616","snapshot_observed_at":"2026-06-30T17:34:57.491104Z","title":"Defending against neural fake news","venue":null,"work_id":"a9b1d209-1cac-4415-9687-0ec9ae25c6a6","year":2020},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1905.12616","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:8523bae01a5286b8b5ea81fdad79f418ecf7c8f5ab371dc0239190ea9443a953","observation_id":"2b39f71e-71ad-40f3-986d-520bbfb85496","resolution":{"observed_at":"2026-05-10T20:53:17.352441Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"booktitle=iclr, year=","venue":null,"work_id":"207d1e87-77ce-4a22-902b-6b8e00aafa71","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":53,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1e3b85dfe29b6017a0189a08f2af2c72168f988dfafecad425b2ba007b271d0f","observation_id":"cf6c6822-e57e-4860-8d53-c6e50b7c5b07","resolution":{"observed_at":"2026-05-16T01:22:04.288927Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-07T04:03:19.012548Z","title":"and Schwenk, Holger and Stoyanov, Veselin","venue":null,"work_id":"3d8a85b8-89c5-4849-a6fe-d38f29278e5f","year":2018},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:9e384c01887bf54446f77b6189b32983ad12d7c24859102240f08581323bcce3","observation_id":"9962b6ea-1f42-49ab-ba8f-f2ca02a8b451","resolution":{"observed_at":"2026-05-16T01:22:04.261629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bowman , journal=","venue":null,"work_id":"a335c5c7-d1e6-46c4-9ab4-632a132165bb","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e05e47505780509d71e51ddfd0185ae2f2509cd1e1423e6b55cd9cdf3e84ff56","observation_id":"684be699-374e-45e1-8013-c2c35034c74b","resolution":{"observed_at":"2026-05-16T01:22:04.333914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-05T20:51:25.241014Z","title":null,"venue":null,"work_id":"e7435cfb-6168-497f-a618-6d31936ba602","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:82b65313e07b5c627058207e0d2c4052290bc994fae50529e8d3f840675658d4","observation_id":"8212a33a-09c7-4ec9-a9e2-6399c251c8f3","resolution":{"observed_at":"2026-05-16T01:22:04.070671Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1ce07650-7b4d-48e1-8a3f-0c2fecd9fc68","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:f67df89cb695f104287d7fd2eced31a83a83af2570bbabcc63a3e0de40f708b7","observation_id":"514ca15e-fff7-45c4-8fd0-693bb9e74e35","resolution":{"observed_at":"2026-05-16T01:22:04.010996Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2011 AAAI Spring Symposium Series , year=","venue":null,"work_id":"2180acc6-aa6e-4d96-9b72-57196160684f","year":2011},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d8920fe01837ef7ec727902c19a0ff4417a577977b3ff5ae373971a8c5966d58","observation_id":"924b6baf-ba2f-48ee-bcd0-5d2d1d8be2be","resolution":{"observed_at":"2026-05-10T20:53:19.140299Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of the 2018 Conference of the North American Chapter of the Association for Computational Linguistics: Human Language Technologies, Volume 1 (Long Papers) , pages=","venue":null,"work_id":"1529dad6-85db-47c0-b05a-be5d184ff13b","year":2018},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1bd372c1fbf0bf52db3ff76983df37ba8acb66595fc277ad050dcc3e34a39b7d","observation_id":"313ab6e4-f275-4c40-b4ee-442dfbe5cb0a","resolution":{"observed_at":"2026-05-10T20:53:19.085255Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4ac4add0-dbe2-4c83-9b81-a47d29c1eaa3","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e4ec9d28da7e61af130f8f097ecff195b498a8414e153be06ba6c88f8d5a4187","observation_id":"66d46727-a235-440d-bd61-aab929069976","resolution":{"observed_at":"2026-05-10T20:53:18.905609Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"2534bf2c-0734-4f87-8987-a9de4fe87040","year":2006},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:bfa503a5e25f49a08e34a8b3f8c92411d6d8a444b1d569050da2a7502871eb68","observation_id":"5b9c897a-468d-428e-b589-0740bc433a87","resolution":{"observed_at":"2026-05-10T20:53:18.719342Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The second","venue":null,"work_id":"34963431-0c86-445d-ab94-20399f1b172e","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:2087e231bbdee204dae0051213281390acaa83b8562e17d49d8c4b3354161f3b","observation_id":"aa5b7abc-a485-498c-9a54-4ac94e240bfc","resolution":{"observed_at":"2026-05-10T20:53:18.571631Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The third","venue":null,"work_id":"5eecc877-c00a-458b-8bcd-afee3068a99d","year":2007},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:6084888039a734205497bfcf8cd72e8a4542c8aa42ae9d51f3d42bc20802c149","observation_id":"03f139b4-9728-4fb5-9fee-b5d020f6fb58","resolution":{"observed_at":"2026-05-10T20:53:18.346159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Fifth","venue":null,"work_id":"e9398de0-920e-4aa0-8db9-b5f33843a9cd","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:13e4d56d1b04ed1aae4e98b830e042e164d606c658e12f8f830c0eca37b4f4b0","observation_id":"01694f1c-6372-49a6-8723-aa6b5721d4e5","resolution":{"observed_at":"2026-05-16T01:22:03.952868Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f1c9716b-d521-4841-bb32-ab49d5ca5a0d","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e41cd4e30b48c73449a947e45fa633a67711968bdfee2e6f70c921ebaad18a61","observation_id":"164e1ca8-be41-4c28-a829-c4142b841fa7","resolution":{"observed_at":"2026-05-16T01:22:04.092329Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of NAACL-HLT , year=","venue":null,"work_id":"ba7d1054-c070-48dc-9638-6a30e946f2f1","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:a9eb9f0cbdb217a6fafb2f674ea43c27727535326b29355a7e049f2c8155e072","observation_id":"e19636ee-0089-40c1-8d7d-fbd848823e21","resolution":{"observed_at":"2026-05-16T01:22:04.024454Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Proceedings of EMNLP , year=","venue":null,"work_id":"1726c477-a75f-4b70-b5ef-c3afcb93c7ff","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:529d33e43a982796df58b3fd3075aed8f8a81216c2cb6f8f565583fa93f1bc1f","observation_id":"f1600121-dba2-4b4b-8bca-6f100c8f7042","resolution":{"observed_at":"2026-05-16T01:22:04.276546Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"e272f493-f9d2-4e20-9563-b3afcbedcc65","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:34647323c6f420bc7a93d3a16a4764df7979d970c533755c61df2632c14cf15c","observation_id":"f1c8e89b-9743-4808-8709-7c2edc926536","resolution":{"observed_at":"2026-05-16T01:22:03.989577Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Automatic Differentiation in","venue":null,"work_id":"7eb66b38-b84f-4fb5-a53d-89f621fa9a9f","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:4ce6e3335542b921bd85d490f0ee1d45d0e714f788b2320da986056728bcdea6","observation_id":"79b59ab3-1a4f-4e75-a3a4-00918e50bf5c","resolution":{"observed_at":"2026-05-16T01:22:04.074693Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5c4721a0-2dc4-4f08-8142-8208c597382a","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:fd1f638bc2a2c6651965a73c50a2069438f77419d262090f9fb511fc311cdabd","observation_id":"9c280ecc-6180-4342-b8e6-fa412329763d","resolution":{"observed_at":"2026-05-16T01:22:03.935959Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09482","last_updated":"2019-04-20T19:11:00Z","snapshot_observed_at":"2026-08-04T02:03:00.719600Z","submitted_at":"2019-04-20T19:11:00Z","title":"Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding","version":1},"cited_work":{"arxiv_id":"1904.09482","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.09482","snapshot_observed_at":"2026-07-01T12:05:43.645108Z","title":"Improving Multi-Task Deep Neural Networks via Knowledge Distillation for Natural Language Understanding","venue":"cs.CL","work_id":"ca3cef6e-af7c-4e5c-aa36-5baf1aa2c7a0","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1904.09482","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:330ea7ac85d101d7a44b6be2123db6f28310159f89119d656ca05181a8b2aace","observation_id":"e433a410-ddc6-42cc-ade1-d9b807864690","resolution":{"observed_at":"2026-05-10T20:53:17.356706Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.06290","last_updated":"2019-08-04T09:06:11Z","snapshot_observed_at":"2026-07-06T07:53:15.177000Z","submitted_at":"2019-05-15T16:47:11Z","title":"A Surprisingly Robust Trick for Winograd Schema Challenge","version":2},"cited_work":{"arxiv_id":"1905.06290","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1905.06290","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"A surprisingly robust trick for winograd schema challenge","venue":null,"work_id":"f0f8b9ab-17db-47db-ae7f-05218b4dbacf","year":1905},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1905.06290","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:63be57d0f21be2020824cab4f526e03bcd970af432c9d224bab108ec93543281","observation_id":"2c3807ac-3c46-4cad-aa0f-9a0f02ddcded","resolution":{"observed_at":"2026-05-10T20:53:17.368095Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1811.01088","last_updated":"2019-02-27T19:07:16Z","snapshot_observed_at":"2026-07-06T07:12:20.854449Z","submitted_at":"2018-11-02T21:04:24Z","title":"Sentence Encoders on STILTs: Supplementary Training on Intermediate Labeled-data Tasks","version":2},"cited_work":{"arxiv_id":"1811.01088","doi":null,"metadata_source":"pith","pith_arxiv_id":"1811.01088","snapshot_observed_at":"2026-07-04T09:59:45.325250Z","title":"Sentence Encoders on STILTs: Supplementary Training on Intermediate Labeled-data Tasks","venue":"cs.CL","work_id":"c76b8897-3ef0-4764-8f5e-6d3f62fce9e6","year":2018},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1811.01088","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d1bf17a571db405822a9a9c38e2733f733c023ca4f34eeeeefd6cdc9be5e59af","observation_id":"a3ec45a0-77a1-4188-8589-e6592d8ceac3","resolution":{"observed_at":"2026-05-10T20:53:17.374789Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2017 , Note =","venue":null,"work_id":"da283866-b5f6-4e20-95e8-9e98530a8d55","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1a6f76f90c377bcdb28aa8e2c1458ea5fe348d55af84f173ed44512b89cf1554","observation_id":"1291ce86-41eb-4978-97a1-19144d4dac9e","resolution":{"observed_at":"2026-05-16T01:22:04.319290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , year=","venue":null,"work_id":"3620cba5-abf3-4200-9f09-080189898fd5","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:4b450bf994d48de6e8a2e0d4a8fed556a4e1b9b482c1c88c9dcdad7c53198c3f","observation_id":"03dc8be0-daf8-47f9-bfa6-fd2bc6548e16","resolution":{"observed_at":"2026-05-16T01:22:04.211005Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c3a148ee-9ce2-4b47-9935-d62bd39bcaf7","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:22d02e5870aa149207ddea2c4e8ed81e2b837ce5fde88c4580c7e89ee0ca59e6","observation_id":"7ebc58b6-30e6-4607-89ad-d89412281897","resolution":{"observed_at":"2026-05-16T01:22:03.961057Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1905.05583","last_updated":"2020-02-05T12:00:32Z","snapshot_observed_at":"2026-07-06T07:52:52.107248Z","submitted_at":"2019-05-14T13:17:26Z","title":"How to Fine-Tune BERT for Text Classification?","version":3},"cited_work":{"arxiv_id":"1905.05583","doi":"10.48550/arxiv.1905.05583","metadata_source":"arxiv_reference","pith_arxiv_id":"1905.05583","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"How to ﬁne-tune bert for text classiﬁcation?","venue":null,"work_id":"8d7a5fda-5709-4b82-b6f8-da2e91f4f543","year":1905},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1905.05583","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:52bcdacbcd831f1862c7eb6acdacebaf849cd65a018f423b602b1d0995bf6949","observation_id":"e4e5b810-f296-40b7-be6f-a77e1dd6a4c6","resolution":{"observed_at":"2026-05-10T20:53:17.383063Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"58bffe56-d068-4d3d-ac95-2b1aa910c207","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:285db3a01ac7873542f9f8bd99b1403fb22130ae7fa260547052c1e41dc6db21","observation_id":"06e8c59f-0107-43cd-b73a-cb4f3048ecd6","resolution":{"observed_at":"2026-05-16T01:22:04.176010Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"5th Workshop on Energy Efficient Machine Learning and Cognitive Computing , year=","venue":null,"work_id":"57e57e43-faf2-47cb-a7ad-35bb407a5463","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:4366a8824881ccd3b45065bc1e6c23563eb1123dc8493dcddb5633bc8ebdfc5a","observation_id":"bd6cb1cf-db91-4cfa-b528-e3624d3e2a85","resolution":{"observed_at":"2026-05-16T01:22:03.915779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1901.11504","last_updated":"2019-05-30T00:01:20Z","snapshot_observed_at":"2026-07-06T07:30:20.997518Z","submitted_at":"2019-01-31T18:07:25Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","version":2},"cited_work":{"arxiv_id":"1901.11504","doi":null,"metadata_source":"pith","pith_arxiv_id":"1901.11504","snapshot_observed_at":"2026-07-04T12:49:51.909964Z","title":"Multi-Task Deep Neural Networks for Natural Language Understanding","venue":"cs.CL","work_id":"f57b1561-a825-41b7-8759-04a1f8e9aa38","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1901.11504","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:ebfea9426294ff193a068e02e49e5f64b1b6a6ee1d35d75e5df57e4ce966af7f","observation_id":"bc14eb0b-5cdc-44a2-92a6-3bdaf5057ae6","resolution":{"observed_at":"2026-05-10T20:53:17.390694Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1607.06450","last_updated":"2016-07-21T19:57:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2016-07-21T19:57:52Z","title":"Layer Normalization","version":1},"cited_work":{"arxiv_id":"1607.06450","doi":"10.1007/978-3-319-32025-0","metadata_source":"pith","pith_arxiv_id":"1607.06450","snapshot_observed_at":"2026-07-11T11:50:26.030339Z","title":"Layer Normalization","venue":"stat.ML","work_id":"20a2d720-0046-4c7c-bcd6-327ec8143f69","year":2016},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1607.06450","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:a7ce4ae160a277f18e372f07f078bea321f95e9411ae30845f8a0c3049ad05a7","observation_id":"22e1cf6b-1634-401a-9cc6-957cd9cf4c6c","resolution":{"observed_at":"2026-05-10T20:53:17.396779Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bf39e0d1-c7cc-4080-8e3a-01809c75b655","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:9aefae23af018de52b658fecc5430e9884739dd8ce46cf29adb51be1cb111062","observation_id":"956b65ba-2206-4e25-8dd8-3e9294656b77","resolution":{"observed_at":"2026-05-16T01:22:04.299561Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1904.05255","last_updated":"2019-04-10T15:52:13Z","snapshot_observed_at":"2026-08-03T07:22:24.476902Z","submitted_at":"2019-04-10T15:52:13Z","title":"Simple BERT Models for Relation Extraction and Semantic Role Labeling","version":1},"cited_work":{"arxiv_id":"1904.05255","doi":null,"metadata_source":"pith","pith_arxiv_id":"1904.05255","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Simple BERT Models for Relation Extraction and Semantic Role Labeling","venue":"cs.CL","work_id":"23c69287-b026-4b6a-bfc7-75b80e7e498a","year":2019},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1904.05255","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:7c97ec888d98e9f8c126b3749504aad311e8519594a3533d83fee0f349014e0a","observation_id":"0b06c690-e18c-4205-98a5-f53ed05cef8b","resolution":{"observed_at":"2026-05-10T20:53:17.404574Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8a8ab123-c7c5-4618-89b7-04ce51d10669","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e75f96f322deae290352c1b65d12817f85c156179cffdd680a9c2a17bf0a48db","observation_id":"9f587f0e-4b5f-409c-8946-ce7d48db2155","resolution":{"observed_at":"2026-05-16T01:22:04.292582Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"2nd Workshop on Representation Learning for NLP , year=","venue":null,"work_id":"3b81e214-6297-4437-b72e-787c3d0a035b","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:be625ae7cf70735d5982e287d6ba1f82dc06c8945d94922c9db7094e01fc6974","observation_id":"01b8d3cc-406f-4f77-8afd-d7a98922ba21","resolution":{"observed_at":"2026-05-16T01:22:03.924304Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.00489","last_updated":"2018-02-24T00:16:12Z","snapshot_observed_at":"2026-07-06T06:07:16.807271Z","submitted_at":"2017-11-01T18:04:31Z","title":"Don't Decay the Learning Rate, Increase the Batch Size","version":2},"cited_work":{"arxiv_id":"1711.00489","doi":null,"metadata_source":"pith","pith_arxiv_id":"1711.00489","snapshot_observed_at":"2026-07-03T17:18:43.523542Z","title":"Don't Decay the Learning Rate, Increase the Batch Size","venue":"cs.LG","work_id":"04ddda12-c77f-444d-88b2-5f4786276d69","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1711.00489","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c94156ae5bcb9bc8e202706f8df3b28ba4a4ce028742bf307107a5ab73b629da","observation_id":"ee04bb23-3b3c-4993-8bd4-af26fc87c4a7","resolution":{"observed_at":"2026-05-10T20:53:17.408413Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1706.02677","last_updated":"2018-04-30T21:53:41Z","snapshot_observed_at":"2026-07-06T05:46:07.424788Z","submitted_at":"2017-06-08T16:51:53Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","version":2},"cited_work":{"arxiv_id":"1706.02677","doi":"10.48550/arxiv.1706.02677","metadata_source":"pith","pith_arxiv_id":"1706.02677","snapshot_observed_at":"2026-07-10T06:15:00.866473Z","title":"Accurate, Large Minibatch SGD: Training ImageNet in 1 Hour","venue":"cs.CV","work_id":"f3dc32a4-cf81-467b-8ff4-3b2f21d3bf1f","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1706.02677","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:f61e95ea047195e30c900dc70cbc36b0b31baed9cf64f16ba2db8fc74f251e78","observation_id":"dfcbaa25-f05a-461e-9cc1-b469a50b77ad","resolution":{"observed_at":"2026-05-12T07:20:31.604247Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-13T20:21:09.485311+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.05326","last_updated":"2018-08-16T02:21:01Z","snapshot_observed_at":"2026-07-30T13:44:04.597749Z","submitted_at":"2018-08-16T02:21:01Z","title":"SWAG: A Large-Scale Adversarial Dataset for Grounded Commonsense Inference","version":1},"cited_work":{"arxiv_id":"1808.05326","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1808.05326","snapshot_observed_at":"2026-07-04T22:59:28.152591Z","title":"arXiv preprint arXiv:1808.05326 , year=","venue":null,"work_id":"f6f02618-3bd0-407b-a1db-5f4d64832fcf","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1808.05326","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:3ac4d378deba1779cef54892fb33e5200a745420ed857c49475170262ec1b995","observation_id":"e0e3d736-4b4d-45d3-b39a-6300f927aea1","resolution":{"observed_at":"2026-07-04T22:59:28.152591Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"ce4c7c8c-2a5b-4c1c-9853-8a66f282391a","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:0eefea1388a245802988bc8539e1d36ef4e86e60ff030d84359ded097d58f81d","observation_id":"21c57c21-f599-4cf2-a8d2-b7ab31d8b581","resolution":{"observed_at":"2026-05-16T01:22:04.048184Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"93721002-4b2d-4643-92db-0d5046c491d5","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:bd351c29e159a0db7c443da7645b765949e5f84dd4fb1b37ba12b1c667c52689","observation_id":"52bbd719-8c13-4124-a52c-722cb47643cf","resolution":{"observed_at":"2026-05-16T01:22:04.040353Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05179","last_updated":"2017-06-11T11:51:06Z","snapshot_observed_at":"2026-08-01T17:16:13.609906Z","submitted_at":"2017-04-18T02:42:17Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","version":3},"cited_work":{"arxiv_id":"1704.05179","doi":null,"metadata_source":"pith","pith_arxiv_id":"1704.05179","snapshot_observed_at":"2026-07-04T10:19:47.711780Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","venue":"cs.CL","work_id":"36f9e481-040c-467f-99a9-a4986b0467a6","year":2017},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1704.05179","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:de998a33b386669e39f71d37f27ac5affeaaaa376351cd783071a7eac782dc2e","observation_id":"890e9ddc-ac26-44ea-a50f-1ff4ca116ecc","resolution":{"observed_at":"2026-05-10T20:53:17.428938Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"11897b33-5a1d-421d-a448-e7b1cb204ede","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:b66fe22be6bd779944c2882bc41cb6bf998c522de3e7a438a8e866a66a480047","observation_id":"9e54e497-3b4e-47ed-9ae9-79cb1e6defd2","resolution":{"observed_at":"2026-05-16T01:22:04.015180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Higher-Order Coreference Resolution with Coarse-to-Fine Inference","venue":null,"work_id":"18f25c3a-ac80-459a-9008-8f6b16fa5445","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:1802fcf501f57f62da9b9f681543e4942b8c6b5c9f798d11a80453d556ab266e","observation_id":"a6df8fad-f8b1-4f4e-9edc-c1c654c8ed21","resolution":{"observed_at":"2026-05-16T01:22:04.130180Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in neural information processing systems , year=","venue":null,"work_id":"c56e7e12-91fc-486c-a528-e363365a7f9b","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:d7b535e78d80e6d34795f7bf4b296438b734dde66c969193cca7688cfd7d3603","observation_id":"c16d0f42-05b7-4a83-8b92-afc22c6e8ee7","resolution":{"observed_at":"2026-05-16T01:22:03.919705Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"0d0c2d5a-a962-4c67-81cd-10ecc6f7d977","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:b7275ff873411df0793ed0d5dbb22ae7bf9d42a52ab4c3a145c1fe671419b0f3","observation_id":"e60a2f5c-d767-460c-9f2d-c48d81bb8a8d","resolution":{"observed_at":"2026-05-16T01:22:04.003331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"1093d7ec-cb12-45ea-9ee4-638b40f89562","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:ec5225f16b605817f25ae44d19ae23249b0b01feee317ff793c01bb50b9f3eee","observation_id":"9411d8d6-b4db-4c41-bb4c-a0200ad9a814","resolution":{"observed_at":"2026-05-16T01:22:04.258345Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Machine Learning Challenges Workshop , year=","venue":null,"work_id":"9b8214a7-6f99-4cc6-8a8c-ca33432725e6","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:e5f6a484beaa7e5cdca8c38869b7e8d950b085eda6cb36051f182b2ba3f8f143","observation_id":"1f5575cc-468b-44ec-afbf-a7cf72d6b1f1","resolution":{"observed_at":"2026-05-16T01:22:04.116643Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"d1aa100d-f133-4377-8c37-41715f55124e","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:8d259a4064ec2d5f282e96e50a7dd5d07ce8ac01535978a5c31ce5dd69f59c76","observation_id":"8252c079-4be0-4cd6-adaa-7d0af6690607","resolution":{"observed_at":"2026-05-16T01:22:04.029755Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1611.01436","last_updated":"2017-03-17T18:11:12Z","snapshot_observed_at":"2026-08-03T14:50:59.589500Z","submitted_at":"2016-11-04T16:12:46Z","title":"Learning Recurrent Span Representations for Extractive Question Answering","version":2},"cited_work":{"arxiv_id":"1611.01436","doi":null,"metadata_source":"pith","pith_arxiv_id":"1611.01436","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Learning Recurrent Span Representations for Extractive Question Answering","venue":"cs.CL","work_id":"5ccbabc0-21a2-4230-9096-91e4b8b56c97","year":2016},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/1611.01436","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:7fe7f3b912f1c718dc3425332f0e35190ab8c9fbc8fd9068b7e65eecf4b3e5a1","observation_id":"3906eb7e-9571-45cc-a2f1-33f46020b141","resolution":{"observed_at":"2026-05-10T20:53:17.436762Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"c42a1121-3812-4b17-88de-097fdd4ec877","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c3a0238b21618558a34a423f19f39d3543b0956d41ef8a61cd34f86d0a1759b5","observation_id":"199343ea-32b4-44d9-a691-aa45665ce3e6","resolution":{"observed_at":"2026-05-16T01:22:04.083211Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"5ab3c31e-26da-4fc4-8da7-4c23dd939335","year":null},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:6bea75a86291b787fdce320226672dc2ce0200e3bcb7b412b710a1d7f9a6751c","observation_id":"c58d9b31-ec35-4a41-8f30-5ff0bd5cfd47","resolution":{"observed_at":"2026-05-16T01:22:04.327402Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-04T06:34:03.388597+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","latest_version":4,"primary_category":"cs.CL","snapshot_observed_at":"2026-07-06T13:05:54.518154Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":25,"parse_uncertain":0,"unresolved":32,"verified_exact":7,"verified_fuzzy":36},"total_outbound_references":294},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-04T06:34:03.388597+00:00","source":"crossref"},{"observed_at":"2026-08-04T06:33:57.428241+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 294 outbound references and 100 inbound Pith citation observations for arXiv:2205.01068."}