{"as_of":"2026-08-23T17:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:c8458a7a400f6d768f9446f0a523e0304167e2a483a121767bcc5376753a8e1b","coverage":[{"denominator":115,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-17T12:55:41.551478Z","state":"measured"},{"denominator":161,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":161,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-23T06:30:58.430688+00:00","state":"measured"},{"denominator":61,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":61,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:54:28.445597Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":1,"source":"pith","source_observed_at":"2026-08-05T02:28:24.338817Z","state":"measured"}],"external_citation_measurements":[{"count":297,"observed_at":"2026-08-05T02:28:24.338817Z","source":"pith"}],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2201.08239","last_updated":"2022-02-10T16:30:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-01-20T15:44:37Z","title":"LaMDA: Language Models for Dialog Applications","version":3},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-05-12T03:17:32.272353Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2201.08239"},"observation_digest":"sha256:6b9c97a3df8592bca485729f2a396e79b57d80d8da40d4bcfddefaa7d012366b","observation_id":"322d4ed2-3359-46e8-9fdc-5d6dad29c4d8","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2204.02311","last_updated":"2022-10-05T06:02:24Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-05T16:11:45Z","title":"PaLM: Scaling Language Modeling with Pathways","version":5},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-10T23:45:06.755839Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2204.02311"},"observation_digest":"sha256:dbfcd14059388801fdb29b6a08f3d49db993c0c7d4bb12dbeb7a23d825c53fdc","observation_id":"803f1c1d-36be-48bc-9a31-2f800888bf35","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2204.05862","last_updated":"2022-04-12T15:02:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-04-12T15:02:38Z","title":"Training a Helpful and Harmless Assistant with Reinforcement Learning from Human Feedback","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-10T13:35:55.949167Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2204.05862"},"observation_digest":"sha256:af3c76df6007010d78ce89020c8003d89d92880cf00d9b6a1f24a6c9555a09f8","observation_id":"53aecb46-2271-4cbd-89de-c2266841af08","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2205.01068","last_updated":"2022-06-21T17:04:40Z","snapshot_observed_at":"2026-08-06T03:13:37.403059Z","submitted_at":"2022-05-02T17:49:50Z","title":"OPT: Open Pre-trained Transformer Language Models","version":4},"reference_index":272,"source":"arxiv_source","source_observed_at":"2026-05-10T20:53:16.720145Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2205.01068"},"observation_digest":"sha256:c7b5260a5767647cd7f016e54bc3a10ebb3c877d86acf138b51a209db55d3bee","observation_id":"126a5f02-d8ec-41cc-82e5-e9dfb230a5d6","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2205.06175","last_updated":"2022-11-11T10:04:29Z","snapshot_observed_at":"2026-08-14T09:46:32.787845Z","submitted_at":"2022-05-12T16:03:26Z","title":"A Generalist Agent","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-05-13T06:24:49.833638Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2205.06175"},"observation_digest":"sha256:c0ee6ce09cc217be8c12511fbdde82b6aa74feda75150bfa5bbac67cde4356f4","observation_id":"a5c447eb-7241-402a-92f5-0947ff3b497b","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2206.07682","last_updated":"2022-10-26T05:06:24Z","snapshot_observed_at":"2026-08-17T00:14:01.413100Z","submitted_at":"2022-06-15T17:32:01Z","title":"Emergent Abilities of Large Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-11T07:38:37.734402Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2206.07682"},"observation_digest":"sha256:5c62fb8ec5dcf3e57823d5b1e080eccbef0e30cc3b45ba4c209892f9b90b3f12","observation_id":"65a1d8b9-a720-464e-9997-1351f5d995f4","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2207.05221","last_updated":"2022-11-21T16:38:35Z","snapshot_observed_at":"2026-08-14T05:42:29.067319Z","submitted_at":"2022-07-11T22:59:39Z","title":"Language Models (Mostly) Know What They Know","version":4},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-10T15:42:47.274448Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2207.05221"},"observation_digest":"sha256:40a2cbac0ad14e6b4e340154ede8db295240cf8e890234e526edb1757e1367f5","observation_id":"7baf866b-2ae1-45b0-bc38-6e6ca3a36a24","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-13T00:16:02.335397Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-16T13:48:43.024120Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2208.03299"},"observation_digest":"sha256:f5d94dbb5ccb9c89b386be974d99ac0301c7e5ec8f949719cd13a2adfc7c10ac","observation_id":"58c0673d-22fe-46b1-ac3e-c64a147a87a7","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2208.03299","last_updated":"2022-11-16T16:38:18Z","snapshot_observed_at":"2026-08-13T00:16:02.335397Z","submitted_at":"2022-08-05T17:39:22Z","title":"Atlas: Few-shot Learning with Retrieval Augmented Language Models","version":3},"reference_index":175,"source":"arxiv_source","source_observed_at":"2026-05-16T13:48:43.024120Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2208.03299"},"observation_digest":"sha256:edafbb7b92883fac1bf228c0858d1e201af3e8b636209961363c50e89475d515","observation_id":"5809b6f4-b273-404b-a6bf-163976dbbc24","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:1b11ab8b11f3fe12dc3c9a2aa9e347fd4a1efcc9f575d857e23d78c773d4e43b","observation_id":"11c6ec29-cb9c-4375-844c-d3995797c635","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2211.09085","last_updated":"2022-11-16T18:06:33Z","snapshot_observed_at":"2026-08-17T08:35:32.078396Z","submitted_at":"2022-11-16T18:06:33Z","title":"Galactica: A Large Language Model for Science","version":1},"reference_index":147,"source":"arxiv_source","source_observed_at":"2026-05-13T05:53:21.810346Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2211.09085"},"observation_digest":"sha256:a8eb1f0dbee3f58eec41a2f632104f7bceb6b208d9c3b524aa9e77cefb036650","observation_id":"59a7c538-4079-4bb8-9e64-3bfb30bed279","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2301.12652","last_updated":"2023-05-24T05:08:07Z","snapshot_observed_at":"2026-08-17T20:02:13.545674Z","submitted_at":"2023-01-30T04:18:09Z","title":"REPLUG: Retrieval-Augmented Black-Box Language Models","version":4},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T12:41:53.833754Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2301.12652"},"observation_digest":"sha256:4d6557730a1e1dbe5b94b4e7826c0e0082b73d48d71b6892738cc368a7998ba3","observation_id":"52e6d598-17f7-4891-866b-6c80959fdb3a","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2305.02301","last_updated":"2023-07-05T16:59:31Z","snapshot_observed_at":"2026-08-17T13:50:40.586963Z","submitted_at":"2023-05-03T17:50:56Z","title":"Distilling Step-by-Step! Outperforming Larger Language Models with Less Training Data and Smaller Model Sizes","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-21T20:50:09.265838Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2305.02301"},"observation_digest":"sha256:385ed7a758a300a6c639d80f3e84f784dd3d1f7780a51067f1e324575ed7ba6c","observation_id":"94ff6684-d054-4fbc-b45a-9ecd58920b85","resolution":{"observed_at":"2026-05-21T20:50:09.369369Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2401.18059","last_updated":"2024-01-31T18:30:21Z","snapshot_observed_at":"2026-08-13T16:18:10.557988Z","submitted_at":"2024-01-31T18:30:21Z","title":"RAPTOR: Recursive Abstractive Processing for Tree-Organized Retrieval","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-15T13:07:16.151160Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2401.18059"},"observation_digest":"sha256:7f2aa586c95d8bc8a4465c23fa569b0f17c5a0ff9d3fb0505387b881758443b9","observation_id":"3e4186f1-f559-47e3-b0fd-175e78f2ef31","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-12T11:07:17.110794Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2411.18700","last_updated":"2024-11-27T19:11:49Z","snapshot_observed_at":"2026-08-21T23:55:54.822480Z","submitted_at":"2024-11-27T19:11:49Z","title":"On the Effectiveness of Incremental Training of Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-12T11:07:17.110794Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2411.18700"},"observation_digest":"sha256:3c615838c851a0501bcaa744eaaff7f3061181fa1bade8e4a1acc43874fd134f","observation_id":"ee8b7273-9829-42aa-aa6e-efd1c33d98ab","resolution":{"observed_at":"2026-08-12T11:07:17.110794Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-11T15:06:18.182931Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.11342","last_updated":"2024-12-15T23:52:35Z","snapshot_observed_at":"2026-08-18T06:56:55.920799Z","submitted_at":"2024-12-15T23:52:35Z","title":"One-Shot Multilingual Font Generation Via ViT","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-11T15:06:18.182931Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2412.11342"},"observation_digest":"sha256:e5887ab0a6ac1ff1dd58850ad5d375f9f83810396a8acb3787232ff5fd959471","observation_id":"451ccffc-dbfd-4fd0-956f-c2342b8383c2","resolution":{"observed_at":"2026-08-11T15:06:18.182931Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-11T11:28:32.291091Z","title":"Preprint, arXiv:2112.04426","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15443","last_updated":"2024-12-19T22:51:56Z","snapshot_observed_at":"2026-08-19T13:58:25.728387Z","submitted_at":"2024-12-19T22:51:56Z","title":"SKETCH: Structured Knowledge Enhanced Text Comprehension for Holistic Retrieval","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-11T11:28:32.291091Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2412.15443"},"observation_digest":"sha256:f6502a1a026233510663b65e8caa1ef225c4903e83c8c0ff3e570b1d65659ced","observation_id":"2a39618e-2f65-468f-a200-3f4bc4f32f34","resolution":{"observed_at":"2026-08-11T11:28:32.291091Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-11T00:45:21.644823Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.19312","last_updated":"2024-12-30T15:30:23Z","snapshot_observed_at":"2026-08-19T23:39:15.727998Z","submitted_at":"2024-12-26T18:19:53Z","title":"From Interests to Insights: An LLM Approach to Course Recommendations Using Natural Language Queries","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-11T00:45:21.644823Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2412.19312"},"observation_digest":"sha256:34afaff0df2e20a24943c3b7653404587619a4084ab6eceb55e1c0deb4d41831","observation_id":"6bad00bd-fc83-45bf-a84c-409ef0ed9477","resolution":{"observed_at":"2026-08-11T00:45:21.644823Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-10T20:44:49.015339Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2501.07523","last_updated":"2025-01-23T06:48:22Z","snapshot_observed_at":"2026-08-16T01:39:46.228410Z","submitted_at":"2025-01-13T17:50:30Z","title":"Parallel Key-Value Cache Fusion for Position Invariant RAG","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-10T20:44:49.015339Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2501.07523"},"observation_digest":"sha256:579c2ff6f57b523ee8723adee56f904173c5ba632cb3d05b9d1c3b3c2b015987","observation_id":"6815fd86-d27c-4864-a99b-7d5aac1ccec4","resolution":{"observed_at":"2026-08-10T20:44:49.015339Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-10T16:15:46.405901Z","title":"Qi Chen, Bing Zhao, Haidong Wang, Mingqin Li, Chuanjie Liu, Zengzhong Li, Mao Yang, and Jingdong Wang","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2501.16375","last_updated":"2025-01-23T06:56:18Z","snapshot_observed_at":"2026-08-21T01:25:30.920699Z","submitted_at":"2025-01-23T06:56:18Z","title":"On Storage Neural Network Augmented Approximate Nearest Neighbor Search","version":1},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-10T16:15:46.405901Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2501.16375"},"observation_digest":"sha256:79a3e39544a9610ad4c1ded2d850487210ae79b17bf84f19e43d7bb71b06f579","observation_id":"5724d271-a820-4290-9d81-249a1162bafe","resolution":{"observed_at":"2026-08-10T16:15:46.405901Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-09T23:52:06.095423Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2501.18356","last_updated":"2025-01-30T14:03:36Z","snapshot_observed_at":"2026-08-17T19:25:00.073144Z","submitted_at":"2025-01-30T14:03:36Z","title":"State Stream Transformer (SST) : Emergent Metacognitive Behaviours Through Latent State Persistence","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-09T23:52:06.095423Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2501.18356"},"observation_digest":"sha256:4372a7aab4b5b5c010b47bddd97d0ddb67b27bc80e7a012947366cd7b02d0b39","observation_id":"1917f71e-743e-4070-8448-210fc12ae2e0","resolution":{"observed_at":"2026-08-09T23:52:06.095423Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-08T23:35:38.542045Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2502.04095","last_updated":"2025-02-06T14:12:41Z","snapshot_observed_at":"2026-08-19T19:02:10.867245Z","submitted_at":"2025-02-06T14:12:41Z","title":"LLMs to Support a Domain Specific Knowledge Assistant","version":1},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-08-08T23:35:38.542045Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2502.04095"},"observation_digest":"sha256:f110f4974d63ea148581c221eec1ed59d1376bcb92944214737644d16598582c","observation_id":"85138e6b-6168-47c3-91f9-3c8a9cd3d409","resolution":{"observed_at":"2026-08-08T23:35:38.542045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-10T11:12:28.853475Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2502.15723","last_updated":"2025-03-23T18:27:29Z","snapshot_observed_at":"2026-08-20T11:48:11.806158Z","submitted_at":"2025-01-28T06:06:28Z","title":"Balancing Content Size in RAG-Text2SQL System","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-10T11:12:28.853475Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2502.15723"},"observation_digest":"sha256:986ca234f7c663d658202c12e32d604f1dc5e8abe55b8077e10b282347f6a056","observation_id":"eaf6052f-1d8c-4f5b-a1c2-bd1acf3f2ce6","resolution":{"observed_at":"2026-08-10T11:12:28.853475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-16T11:54:28.445597Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.18560","last_updated":"2025-04-19T16:18:22Z","snapshot_observed_at":"2026-08-22T17:55:09.494446Z","submitted_at":"2025-04-19T16:18:22Z","title":"Mind the Language Gap: Automated and Augmented Evaluation of Bias in LLMs for High- and Low-Resource Languages","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:54:28.445597Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2504.18560"},"observation_digest":"sha256:aa54098951cffc7bc4ec6ab72bc97e027dcbbaf80611d5d0aeb68c4c602c07aa","observation_id":"29419495-9e2b-4812-9465-c72895953b6e","resolution":{"observed_at":"2026-08-16T11:54:28.445597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-16T01:00:46.726047Z","title":"Towards an efficient pipeline for knowledge-intensive nlp tasks","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.02279","last_updated":"2025-05-23T00:28:09Z","snapshot_observed_at":"2026-08-16T00:53:57.265261Z","submitted_at":"2025-05-04T22:18:27Z","title":"A survey of agent interoperability protocols: Model Context Protocol (MCP), Agent Communication Protocol (ACP), Agent-to-Agent Protocol (A2A), and Agent Network Protocol (ANP)","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T01:00:46.726047Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.02279"},"observation_digest":"sha256:1de94eb8969afe07a3d0878061a1cbdf647b525cb3f83c8e5744ce2aba3322b6","observation_id":"c9756baa-30f0-4abe-89ca-9241870fb184","resolution":{"observed_at":"2026-08-16T01:00:46.726047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T23:48:09.785578Z","title":"Improving Language Models by Retrieving from Trillions of Tokens,","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.07842","last_updated":"2025-05-06T17:01:05Z","snapshot_observed_at":"2026-08-16T08:26:14.029297Z","submitted_at":"2025-05-06T17:01:05Z","title":"RAN Cortex: Memory-Augmented Intelligence for Context-Aware Decision-Making in AI-Native Networks","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-15T23:48:09.785578Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.07842"},"observation_digest":"sha256:42039532b31ac5fa7706579c92e6e5edbb67c2389394b3e04462a4843a3541dd","observation_id":"3e52e1e3-612a-44a8-a701-548be122ec2f","resolution":{"observed_at":"2026-08-15T23:48:09.785578Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T21:03:39.358408Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2505.10922","last_updated":"2025-05-16T06:54:52Z","snapshot_observed_at":"2026-08-18T13:15:06.005239Z","submitted_at":"2025-05-16T06:54:52Z","title":"Vaiage: A Multi-Agent Solution to Personalized Travel Planning","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-15T21:03:39.358408Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.10922"},"observation_digest":"sha256:b0c5335cfadb73c34b49a8bbf00577dff0ae3e39ccbcc66e93457d8ca115c996","observation_id":"029643cd-8564-46a4-ac3b-c6e1ae84026c","resolution":{"observed_at":"2026-08-15T21:03:39.358408Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T20:35:45.109396Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12625","last_updated":"2025-05-19T02:16:56Z","snapshot_observed_at":"2026-08-20T01:17:25.141641Z","submitted_at":"2025-05-19T02:16:56Z","title":"R1dacted: Investigating Local Censorship in DeepSeek's R1 Language Model","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T20:35:45.109396Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.12625"},"observation_digest":"sha256:6a1008651660537c3c2a711b326cd49bebc9a5b0650e3bdfbd94d6ca0cb0f42c","observation_id":"31030fdb-7647-475e-bda6-9ca795455bf0","resolution":{"observed_at":"2026-08-15T20:35:45.109396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T20:30:01.500902Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.12859","last_updated":"2025-05-19T08:43:54Z","snapshot_observed_at":"2026-08-15T20:22:43.043326Z","submitted_at":"2025-05-19T08:43:54Z","title":"Re-identification of De-identified Documents with Autoregressive Infilling","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-15T20:30:01.500902Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.12859"},"observation_digest":"sha256:5de244469bc3cb2ee88891e9b672d8efa805882240241ccdbd1f73842e47cb50","observation_id":"5d9d15b4-0330-4a72-b688-a3e5cdaf2059","resolution":{"observed_at":"2026-08-15T20:30:01.500902Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-07T13:59:19.776686Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.20285","last_updated":"2025-05-27T06:46:24Z","snapshot_observed_at":"2026-08-18T03:00:30.140897Z","submitted_at":"2025-05-26T17:58:50Z","title":"MaskSearch: A Universal Pre-Training Framework to Enhance Agentic Search Capability","version":2},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T13:59:19.776686Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2505.20285"},"observation_digest":"sha256:0bba0bc1cdddfba2c7de87e57fa0b1f26090599ce77e6a9db77b5e81ab37c5fa","observation_id":"ea5c364e-f268-47ae-b36d-845df74912f9","resolution":{"observed_at":"2026-08-07T13:59:19.776686Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2506.02153","last_updated":"2025-09-15T22:15:00Z","snapshot_observed_at":"2026-08-12T13:48:47.535846Z","submitted_at":"2025-06-02T18:35:16Z","title":"Small Language Models are the Future of Agentic AI","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-05-16T11:55:50.897500Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2506.02153"},"observation_digest":"sha256:a683ee1e4812136a5c58ad639c9dbcfbe3519077b5d1e62218b0931c167f12b9","observation_id":"a680b8f2-66b5-461f-bb7a-34ed17923cf9","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-06T21:18:54.365731Z","title":"Retro: Retrieval-augmented transformer","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.00453","last_updated":"2025-07-01T06:11:38Z","snapshot_observed_at":"2026-08-09T22:27:17.339307Z","submitted_at":"2025-07-01T06:11:38Z","title":"Recurrent Memory-Augmented Transformers with Chunked Attention for Long-Context Language Modeling","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T21:18:54.365731Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2507.00453"},"observation_digest":"sha256:3eb2909a191c1f8b433a3576870f7b4d2008cbb477dca34ebc46e197d88378e1","observation_id":"1023a173-3e23-4688-898e-e3af789a16b5","resolution":{"observed_at":"2026-08-06T21:18:54.365731Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-06T15:08:28.124568Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.16725","last_updated":"2025-07-31T10:20:56Z","snapshot_observed_at":"2026-08-16T05:45:43.106286Z","submitted_at":"2025-07-22T16:08:12Z","title":"RAVine: Reality-Aligned Evaluation for Agentic Search","version":2},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-06T15:08:28.124568Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2507.16725"},"observation_digest":"sha256:cde11a85bcb582cfe3a4d44c0fc4e35958eb220f779d8482807da54b8dfde552","observation_id":"77db9105-2d22-4760-9d25-91f4dad0a1e7","resolution":{"observed_at":"2026-08-06T15:08:28.124568Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T18:08:11.559742Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2507.18910","last_updated":"2025-07-25T03:05:46Z","snapshot_observed_at":"2026-08-16T16:05:50.570420Z","submitted_at":"2025-07-25T03:05:46Z","title":"A Systematic Review of Key Retrieval-Augmented Generation (RAG) Systems: Progress, Gaps, and Future Directions","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-15T18:08:11.559742Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2507.18910"},"observation_digest":"sha256:5211b069b2d46c2c95d6d0c76e1e7bf698aeebbd06da53e2c1531be9a6bd7b4f","observation_id":"b29999d3-f89f-4f7a-a508-8debce5ff7f7","resolution":{"observed_at":"2026-08-15T18:08:11.559742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T15:32:37.650583Z","title":"Improving language models by retrieving from trillions of tokens,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2508.19800","last_updated":"2025-08-27T11:35:29Z","snapshot_observed_at":"2026-08-15T08:46:17.139650Z","submitted_at":"2025-08-27T11:35:29Z","title":"A Multi-Layered Framework for Modeling Human Biology: From Basic AI Agents to a Full-Body AI Agent","version":1},"reference_index":132,"source":"pdf_text","source_observed_at":"2026-08-05T15:32:37.650583Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2508.19800"},"observation_digest":"sha256:e862404cb0b8fbf4c9e7d24b268608b2916e55012db77d38c6217690c39055e6","observation_id":"5bf838ed-08a1-48aa-9277-5e31ff3de06e","resolution":{"observed_at":"2026-08-05T15:32:37.650583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T15:09:22.251019Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2508.20408","last_updated":"2025-08-28T04:13:51Z","snapshot_observed_at":"2026-08-21T18:25:18.684261Z","submitted_at":"2025-08-28T04:13:51Z","title":"Fact or Facsimile? Evaluating the Factual Robustness of Modern Retrievers","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-05T15:09:22.251019Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2508.20408"},"observation_digest":"sha256:338f31310e38a00fb78ad786bd526a876a2828e6f913ac1d8b661820d58df459","observation_id":"b9e2ddec-87fe-4873-8f32-70eb3395e640","resolution":{"observed_at":"2026-08-05T15:09:22.251019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T13:38:18.045820Z","title":"Improving language models by retrieving from trillions of tokens","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.00510","last_updated":"2025-08-30T14:12:46Z","snapshot_observed_at":"2026-08-16T21:45:27.216051Z","submitted_at":"2025-08-30T14:12:46Z","title":"LLM-Assisted Iterative Evolution with Swarm Intelligence Toward SuperBrain","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-05T13:38:18.045820Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2509.00510"},"observation_digest":"sha256:a6069807130c1dc53883a76b9929b11238139a218f3f56a0a86086c21c9e80b2","observation_id":"7b020a97-e233-4bb2-a7ab-43a7217e7cfb","resolution":{"observed_at":"2026-08-05T13:38:18.045820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2510.02657","last_updated":"2026-01-16T01:29:15Z","snapshot_observed_at":"2026-08-13T07:58:48.811843Z","submitted_at":"2025-10-03T01:26:13Z","title":"Less LLM, More Documents: Searching for Improved RAG","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-18T11:13:01.397197Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2510.02657"},"observation_digest":"sha256:316551b8ec5871c8ece1882a5730930387f29c304aba4bfcfe784e60c85d7d15","observation_id":"484e1337-920f-462a-9de1-2a8bdb5244d2","resolution":{"observed_at":"2026-05-18T11:16:19.222942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2602.00586","last_updated":"2026-05-13T14:48:08Z","snapshot_observed_at":"2026-08-17T15:24:24.554650Z","submitted_at":"2026-01-31T08:05:02Z","title":"RAG-GNN: Integrating Retrieved Knowledge with Graph Neural Networks for Precision Medicine","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-05-16T09:16:11.465881Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2602.00586"},"observation_digest":"sha256:9f665f9a7a8513e2b4d6e948103cb25a0679132ddcd0a4225bc2585174a6d4da","observation_id":"89139d18-c279-49db-8990-353593afc821","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.14403","last_updated":"2026-04-15T20:34:10Z","snapshot_observed_at":"2026-08-15T05:09:00.009871Z","submitted_at":"2026-04-15T20:34:10Z","title":"A Unified Model and Document Representation for On-Device Retrieval-Augmented Generation","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-05-10T11:54:09.047134Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.14403"},"observation_digest":"sha256:75e995a5d4a45173123b223e4df39476e0a8a9a1b390c759d79357e13a557a24","observation_id":"6cdaae22-2d49-40f1-a856-4dc7e712a8b5","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.19820","last_updated":"2026-04-19T07:09:42Z","snapshot_observed_at":"2026-08-12T22:55:55.481477Z","submitted_at":"2026-04-19T07:09:42Z","title":"KnowPilot: Your Knowledge-Driven Copilot for Domain Tasks","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-05-10T06:15:44.360621Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.19820"},"observation_digest":"sha256:b7fc9aeb0f8703a733efbc8957a4c2e827108251981dde37bd52ff80b8bacc86","observation_id":"f83c6003-1435-4635-97d0-421f2c63bd39","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.23593","last_updated":"2026-04-26T08:03:32Z","snapshot_observed_at":"2026-08-14T11:50:53.807369Z","submitted_at":"2026-04-26T08:03:32Z","title":"When AI reviews science: Can we trust the referee?","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-05-08T06:19:54.727724Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.23593"},"observation_digest":"sha256:083765bd184e431606220369ca066e99c9c8299b58a238eefb82f35dd2cd4c2c","observation_id":"80950199-7fd5-4707-83f9-2b70769ea7de","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2604.24334","last_updated":"2026-04-27T11:23:39Z","snapshot_observed_at":"2026-08-07T09:21:22.866131Z","submitted_at":"2026-04-27T11:23:39Z","title":"Reducing Redundancy in Retrieval-Augmented Generation through Chunk Filtering","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-05-08T03:56:49.260151Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2604.24334"},"observation_digest":"sha256:9965d83135b9eb57e564f20ac691618e8b3df98595109e9a45221114c85c7c2e","observation_id":"7d25e897-9d36-4f74-9943-908df51fb0c0","resolution":{"observed_at":"2026-05-17T12:55:41.994998Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2605.18299","last_updated":"2026-05-18T12:18:47Z","snapshot_observed_at":"2026-07-06T23:29:09.538843Z","submitted_at":"2026-05-18T12:18:47Z","title":"SD-Search: On-Policy Hindsight Self-Distillation for Search-Augmented Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-05-20T09:59:17.346548Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2605.18299"},"observation_digest":"sha256:1290a26741755b85286f47e75db7cd8987e08c6ab458a7dc46291c7ca1bba6f0","observation_id":"c49e066b-aa8c-4be9-9451-92ea0d5c66b1","resolution":{"observed_at":"2026-05-20T10:03:14.703602Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2605.22511","last_updated":"2026-05-26T13:56:53Z","snapshot_observed_at":"2026-08-17T19:59:43.530322Z","submitted_at":"2026-05-21T14:00:57Z","title":"Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-05-22T06:08:22.252524Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2605.22511"},"observation_digest":"sha256:3a08667a1c4a2a207ad1409fec5b500069a863aa306fb0a891b9b44674fc295f","observation_id":"2816c841-cbb5-44b9-8ba1-524bb78afbf2","resolution":{"observed_at":"2026-05-22T06:11:09.251268Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2605.22511","last_updated":"2026-05-26T13:56:53Z","snapshot_observed_at":"2026-08-17T19:59:43.530322Z","submitted_at":"2026-05-21T14:00:57Z","title":"Search-E1: Self-Distillation Drives Self-Evolution in Search-Augmented Reasoning","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-30T17:24:26.923687Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2605.22511"},"observation_digest":"sha256:f93f711d0ed7dd55384464b325ee62a4205421ff8dea3b32cbf45cfc4cd766ba","observation_id":"3a3e78d4-e31d-4569-bdad-0557c4947abc","resolution":{"observed_at":"2026-06-30T17:24:56.789918Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2605.27686","last_updated":"2026-05-26T21:03:42Z","snapshot_observed_at":"2026-08-02T04:59:17.402182Z","submitted_at":"2026-05-26T21:03:42Z","title":"Tensor Memory: Fixed-Size Recurrent State for Long-Horizon Transformers","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-29T18:08:42.533804Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2605.27686"},"observation_digest":"sha256:20dd1aa1f4b1d3e03144e05fd4f5ccd64f164a6cab08eb2073ef1f75b1567706","observation_id":"5693060c-9604-4e68-a01f-506986013e0a","resolution":{"observed_at":"2026-06-29T18:13:48.624905Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.00432","last_updated":"2026-05-29T23:47:39Z","snapshot_observed_at":"2026-08-15T10:19:26.474273Z","submitted_at":"2026-05-29T23:47:39Z","title":"Grounded Decoding: Retrieval-Anchored Probability Fusion for Faithful RAG","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-06-28T22:44:06.680222Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.00432"},"observation_digest":"sha256:b12306d4117068afc6b0e5bac81aeb69363b2c283ad6f0313c9e4c2c91e23f4e","observation_id":"04554cb2-4b36-4305-bf64-15b0a261fadf","resolution":{"observed_at":"2026-07-01T19:25:59.931226Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.11712","last_updated":"2026-06-10T06:39:20Z","snapshot_observed_at":"2026-07-31T05:34:22.696346Z","submitted_at":"2026-06-10T06:39:20Z","title":"Substrate Asymmetry in User-Side Memory: A Diagnostic Framework","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-06-27T09:58:16.639702Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.11712"},"observation_digest":"sha256:cbcb8d8cd4be9a05a09fb702f0e2424a26332e54a0ff87f1bc1345609bfdb903","observation_id":"c395f523-3390-42b8-8917-88a2bcac2920","resolution":{"observed_at":"2026-07-03T10:27:57.054174Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.17162","last_updated":"2026-06-15T18:02:55Z","snapshot_observed_at":"2026-08-15T00:31:46.516041Z","submitted_at":"2026-06-15T18:02:55Z","title":"MemSlides: A Hierarchical Memory Driven Agent Framework for Personalized Slide Generation with Multi-turn Local Revision","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-27T03:43:37.671325Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.17162"},"observation_digest":"sha256:8c7f90eb5bf681069ccc77aaded0482b72c6f99c28c524aa92ea6ee71d054aa8","observation_id":"9d132024-7392-4158-a40c-fddb89c51e54","resolution":{"observed_at":"2026-07-03T17:48:46.017018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.22610","last_updated":"2026-06-21T17:37:01Z","snapshot_observed_at":"2026-08-20T10:24:53.184842Z","submitted_at":"2026-06-21T17:37:01Z","title":"PaperClaw: Harnessing Agents for Autonomous Research and Human-in-the-Loop Refinement","version":1},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-06-26T10:36:14.840581Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.22610"},"observation_digest":"sha256:d1117feff983016ca842e48bce8dd59290988f8d88ce305a5e5b2369d6e19ef3","observation_id":"7176ad59-9a78-4481-bdfd-c30d314404ca","resolution":{"observed_at":"2026-07-04T08:59:43.505761Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.26105","last_updated":"2026-05-01T04:45:08Z","snapshot_observed_at":"2026-08-08T18:58:24.822499Z","submitted_at":"2026-05-01T04:45:08Z","title":"Context Recycling for Long-Horizon LLM Inference","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-01T08:11:33.529975Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.26105"},"observation_digest":"sha256:5906786e91b59e9c2a376ab221df517f9d15117ffd7f8d0dd952c79f4d012fb3","observation_id":"02b03649-ef47-4f21-ae07-e9c2ff9a426f","resolution":{"observed_at":"2026-07-01T08:15:31.535616Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-08-12T17:19:42Z","snapshot_observed_at":"2026-08-15T23:12:08.948009Z","submitted_at":"2026-06-27T11:38:43Z","title":"MMLA: How Memory Lets the Past Shape the Future","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-30T09:46:57.030469Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:3ab0aaf5734f2682d9e688cc87cb120f5f9a37d2f9ef76d683740b166aed35fc","observation_id":"ac6c9b03-c696-40a5-9c30-d2abd5addbd8","resolution":{"observed_at":"2026-06-30T09:54:35.252447Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-07-13T07:16:45.194991Z","title":"Improving Language Models by Retrieving from Trillions of Tokens","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.28876","last_updated":"2026-08-12T17:19:42Z","snapshot_observed_at":"2026-08-15T23:12:08.948009Z","submitted_at":"2026-06-27T11:38:43Z","title":"MMLA: How Memory Lets the Past Shape the Future","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-13T07:16:45.194991Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2606.28876"},"observation_digest":"sha256:8cd209c242cad79d0fedddb326d7c5a81accb4f4221071e559425cbda2e6914e","observation_id":"03f07247-a7ff-4dff-b992-de648d71236c","resolution":{"observed_at":"2026-07-13T07:16:45.194991Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2607.02303","last_updated":"2026-07-02T15:19:49Z","snapshot_observed_at":"2026-08-14T02:39:06.621509Z","submitted_at":"2026-07-02T15:19:49Z","title":"A Hippocampus for Linear Attention: An Exact Memory for What the Recurrent State Forgets","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-03T13:46:18.862925Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2607.02303"},"observation_digest":"sha256:ad131a1d23b1548047a85d99bff62516ffb5f578ec819b8d9ebbfdfe526cae86","observation_id":"46f28500-ad8d-4d1f-b15f-61cc28674982","resolution":{"observed_at":"2026-07-03T13:48:20.310811Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2607.06641","last_updated":"2026-07-07T14:47:42Z","snapshot_observed_at":"2026-08-21T20:07:58.937578Z","submitted_at":"2026-07-07T14:47:42Z","title":"Healthier LLMs: Retrieval-Augmented Generation for Public Health Question Answering","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-11T00:44:36.322629Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2607.06641"},"observation_digest":"sha256:cdee8b9ba7841dd7688d2ef791fe212579f6d2c9ba1012ee81982592078e782e","observation_id":"0faecb49-1e96-4529-b35f-cc9720f2d520","resolution":{"observed_at":"2026-07-11T00:47:43.197701Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":"2112.04426","doi":"10.48550/arxiv.2112.04426","metadata_source":"pith","pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Improving language models by retrieving from trillions of tokens","venue":"cs.CL","work_id":"c8e7ce21-2f18-4c10-b0cf-16cd3574fe33","year":2021},"citing_paper":{"arxiv_id":"2607.08032","last_updated":"2026-07-09T01:15:03Z","snapshot_observed_at":"2026-08-18T23:35:57.173534Z","submitted_at":"2026-07-09T01:15:03Z","title":"What to Keep, What to Forget: A Rate--Distortion View of Memory Compaction in LLMs and Agents","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-10T01:26:59.421158Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2607.08032"},"observation_digest":"sha256:60a56eff29d427dd2860edb4d0ddd2697801e0f81467adb4fdd671abbc7d4882","observation_id":"5e22a8a7-b5b7-4d31-a814-d9c3e4c28f5e","resolution":{"observed_at":"2026-07-10T01:36:44.106151Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-01T12:21:55.104315Z","title":"Borgeaud, A","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.19592","last_updated":"2026-07-21T21:38:39Z","snapshot_observed_at":"2026-08-18T15:48:23.060557Z","submitted_at":"2026-07-21T21:38:39Z","title":"Knowledge-Centric Self-Improvement","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T12:21:55.104315Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2607.19592"},"observation_digest":"sha256:a47d692e662d3b23bf57d61468039a5ecd10c3697735506dea8285d93b2c3f6e","observation_id":"05393ec2-5be1-4bb2-bbb9-de456b59d84a","resolution":{"observed_at":"2026-08-01T12:21:55.104315Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-02T07:39:14.045411Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.26071","last_updated":"2026-07-10T13:14:52Z","snapshot_observed_at":"2026-08-20T20:15:46.930707Z","submitted_at":"2026-07-10T13:14:52Z","title":"GuidedRAG: Semantic Steering of Retrieval-Augmented Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T07:39:14.045411Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2607.26071"},"observation_digest":"sha256:52be3f6dd3972833076197c1c99e457a52700a59644690c30782be44bcdf58dc","observation_id":"f77c5765-14da-44dc-a15b-37b3a621dce2","resolution":{"observed_at":"2026-08-02T07:39:14.045411Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-15T15:05:38.899006Z","title":"Rae, Erich Elsen, and Laurent Sifre","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2608.02109","last_updated":"2026-08-03T12:08:56Z","snapshot_observed_at":"2026-08-18T12:38:19.644294Z","submitted_at":"2026-08-03T12:08:56Z","title":"Same Semantics, Different Paths: Self-Improving Alignment for Vision-Text Compression","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-15T15:05:38.899006Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2608.02109"},"observation_digest":"sha256:4b0c1afa06b0e83871686a4f1cc0291bb76dd4fa3edb668c427ef6b021c1a374","observation_id":"a6341cd5-84a7-4958-8a78-81f96c351f18","resolution":{"observed_at":"2026-08-15T15:05:38.899006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2112.04426","snapshot_observed_at":"2026-08-10T22:35:33.889567Z","title":"arXiv , author =:2112.04426 , journal =","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2608.06682","last_updated":"2026-08-07T01:07:12Z","snapshot_observed_at":"2026-08-19T16:45:20.274126Z","submitted_at":"2026-08-07T01:07:12Z","title":"Squarefree numbers in short intervals: explicit and formalized","version":1},"reference_index":152,"source":"arxiv_source","source_observed_at":"2026-08-10T22:35:33.889567Z"},"links":{"cited_paper":"/paper/2112.04426","citing_paper":"/paper/2608.06682"},"observation_digest":"sha256:8be09f8d6e2e945855f99072553cc784d4ea21b1cd48c5a72ba880d7330e8720","observation_id":"227b26e9-fa8a-49d8-bf24-dd28465340b5","resolution":{"observed_at":"2026-08-10T22:35:33.889567Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2112.04426/citation-record","integrity":"/paper/2112.04426/integrity","json":"/paper/2112.04426/citation-record.json","paper":"/paper/2112.04426"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Abadi, A","venue":null,"work_id":"58cb949a-d4d0-4d36-8e64-cbaf72a383bc","year":2016},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a5578af09b1b9f866fb8821bed79db3708bc1716790677f6910435c05f43b687","observation_id":"e3502ab8-7d82-4933-ac50-c73e558e07cf","resolution":{"observed_at":"2026-05-17T12:55:41.939582Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Baevski and M","venue":null,"work_id":"0eba6dc3-5447-4995-bde9-4e9d4b16d8c9","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:f4d98bf93c4abbbc221aab275266e7c88628349dc5f0b7b1b049c88a566eabdd","observation_id":"cc51de47-80aa-4f98-9c67-3ab8772bc01d","resolution":{"observed_at":"2026-05-17T12:55:41.948181Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"06746417-8384-498d-a63b-83b9dd5cd00f","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:ed8997ecaf6f6d9812c1377db0af4aff8b515e6d0bd9cb718b838347d9614c4e","observation_id":"3d23e3e5-7a15-4919-a060-f28541a9e315","resolution":{"observed_at":"2026-05-17T12:55:41.954032Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"4a09d8db-3a2b-4bde-bac9-434a09d5e807","year":2003},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:089d5d070b7524a30823a90b697fc49e87b10833b0133df44cc9fb92affd1dcb","observation_id":"73d038d5-d935-417a-bea3-7ef00bdc5b4c","resolution":{"observed_at":"2026-05-17T12:55:41.957731Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Bradbury, R","venue":null,"work_id":"a93701d4-1bcc-419f-9557-2f43fff982f9","year":2018},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:dc8bcab90500038aeb80edcfb3e175aa09de6ba70b16abc82bc3b350ef509fbc","observation_id":"f78d2419-b6ad-4f33-b6c4-bf98f5414df6","resolution":{"observed_at":"2026-05-17T12:55:41.961039Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brants, A","venue":null,"work_id":"66b4b51d-791c-4af6-91c3-5aa9d53c1355","year":2007},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:ed2e1e33de1f1a1d24f207aa8e9e38d406ee9ba614f83b77fb544dfbe9e1960f","observation_id":"70ff8f70-5bc8-411d-a417-05eaa2cd1c78","resolution":{"observed_at":"2026-05-17T12:55:41.963602Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Brown, B","venue":null,"work_id":"772b5606-6659-4c9d-9915-4d2d015c2aa9","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:f6754d21ab5de2e11436ce377f98ff9c098ff00df31410ce2e64f5b91c754333","observation_id":"53f105d6-91c4-45ac-a28b-5c03bd793d7f","resolution":{"observed_at":"2026-05-17T12:55:41.966311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Carlini, F","venue":null,"work_id":"43eedb99-5c72-4c1e-89ea-6c6d8957fb04","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:0bcf16b0cf9a0aedaac8afa709356c388843548e8f5e3c895d9ed8c90e2a2a60","observation_id":"3cf299d9-a133-4fbc-9e66-9ab49faf7b4f","resolution":{"observed_at":"2026-05-17T12:55:41.968898Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Consonni, D","venue":null,"work_id":"bafdd2d9-79b4-4675-9c92-02ea369ce13c","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:b93cb25df5d239dc01879a1293ff02c903131b761363f6fbedb47e346811e92a","observation_id":"f823cf76-250c-405d-88e2-88b31caf9add","resolution":{"observed_at":"2026-05-17T12:55:41.971223Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Curation corpus base","venue":null,"work_id":"9c6b32b5-868a-4ad3-8249-48f6d8496131","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:44bee869ea00a0db3581ebe4759fe7a177616ce93aa96b11acb299fc47239747","observation_id":"c4a00337-40e5-4efb-864a-1484d3f1fc78","resolution":{"observed_at":"2026-05-17T12:55:41.973708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"365d0639-986b-4633-9b7d-ef9905d5abbe","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:e2af4db181d6e80b1453fbd17e5115905fcb10d3b6b1fc3c523526a5513d7513","observation_id":"598cb976-80e0-46d7-abb5-428bd8f1e5ad","resolution":{"observed_at":"2026-05-17T12:55:41.976397Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Devlin, M.-W","venue":null,"work_id":"a695344f-e7f2-40c0-8b25-b374ae295e50","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c4bb5c26cf5dd6daaeb9d862f506b857950f3949bc5644f6caf3fdb75e58d3e4","observation_id":"216db9ec-fade-46aa-966a-3aa14a1cc4d3","resolution":{"observed_at":"2026-05-17T12:55:41.979835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":"2101.00027","doi":"10.1117/1.jmi.10.6.061104","metadata_source":"pith","pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","venue":"cs.CL","work_id":"9b10667a-da61-4358-aceb-10578234d45d","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:bba1e90a718ceeb8db1907164b44bd5534e4495964989ae47ae7212c76351262","observation_id":"572ebb11-cdbd-4ba0-ab46-5987bca4f7ea","resolution":{"observed_at":"2026-05-17T12:55:41.648189Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Gehman, S","venue":null,"work_id":"194616cd-acfb-4f8f-a13f-0db8f8d4e32c","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c4a33ca271bdb5e425f683ec080545cf810ef39777eca450cdbd271368e0e3b5","observation_id":"3191e2e6-e5ec-49d8-83ff-509e05d61e88","resolution":{"observed_at":"2026-05-17T12:55:41.982226Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Grave, A","venue":null,"work_id":"003318aa-f02c-454a-8fb8-a1b07cc0ac73","year":2017},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:70fb344c5bd9842c0be23a95bc284a1073e6a888c1c1ee3543dc6b7fb489c4d8","observation_id":"d0a75406-5235-471b-88ed-8531dfe0c255","resolution":{"observed_at":"2026-05-17T12:55:41.984523Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1308.0850","last_updated":"2014-06-05T16:04:02Z","snapshot_observed_at":"2026-08-15T00:07:53.077276Z","submitted_at":"2013-08-04T21:04:36Z","title":"Generating Sequences With Recurrent Neural Networks","version":5},"cited_work":{"arxiv_id":"1308.0850","doi":"10.48550/arxiv.1308.0850","metadata_source":"pith","pith_arxiv_id":"1308.0850","snapshot_observed_at":"2026-07-10T20:07:33.400866Z","title":"Generating Sequences With Recurrent Neural Networks","venue":"cs.NE","work_id":"3da63ce3-c701-48e0-a32e-756f2712b58c","year":2013},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/1308.0850","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:137c9faa20e0561fb25f516a06f79a8b32b103ddf9d1928381753f9925788a17","observation_id":"f7009913-d14d-4b9b-9a09-14e4949e6efc","resolution":{"observed_at":"2026-05-17T12:55:41.693205Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"74965628-76a5-44e5-9f35-55172eb51a46","year":2018},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2042fae0bba7c9ffa8180989d9a22cb7a6efead4b844c4eb288ad82344818812","observation_id":"20b6a56b-22b5-4025-8173-b126f5845abf","resolution":{"observed_at":"2026-05-17T12:55:41.987109Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10396","last_updated":"2020-12-04T21:29:31Z","snapshot_observed_at":"2026-08-18T02:50:50.958862Z","submitted_at":"2019-08-27T18:27:17Z","title":"Accelerating Large-Scale Inference with Anisotropic Vector Quantization","version":5},"cited_work":{"arxiv_id":"1908.10396","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.10396","snapshot_observed_at":"2026-07-03T13:28:18.591775Z","title":"Accelerating large-scale inference with anisotropic vector quantization","venue":null,"work_id":"7e107e6f-d00e-488f-95c5-bd6f23e56925","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/1908.10396","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a99eb539b5dd015149b8ddf68480fe2d2baf30df4ea5a8583ba8a13f9ecba80a","observation_id":"3381c33e-a3a0-46d6-a97f-0ec50f53e1e3","resolution":{"observed_at":"2026-05-17T12:55:41.697929Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"095fccfe-ca41-481a-92fe-f59c206a71fa","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c37c584a358488b48b3cf9e1edabb87f710bc6e87c9040f851aac2e93c68a60d","observation_id":"fb725c10-c776-4bca-bce3-2f5752fc4710","resolution":{"observed_at":"2026-05-17T12:55:41.989322Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hashemi, H","venue":null,"work_id":"687d9631-11b7-4677-9f6e-6b5624704444","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:b04cf3a44938cf5f5ed71186a038f973b4712a7b09dca006a176b20ee611020e","observation_id":"70ad69c3-a3db-4a92-aab0-1e3444ee5601","resolution":{"observed_at":"2026-05-17T12:55:41.991664Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Hennigan, T","venue":null,"work_id":"0056db7e-05fe-4c29-a84a-f4d9d6786f26","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:53c10642ac833105bfae35006178649350a28bb6355698083ef5ff24cefdd3bf","observation_id":"f9f273be-580c-4edb-9c8f-a3e24d656b9e","resolution":{"observed_at":"2026-05-17T12:55:41.994094Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Izacard and E","venue":null,"work_id":"4ce3bf57-fd24-4a7c-b8c7-a5d239dbe276","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:8458c20ed5e4ad5dcc9f3494a9c09e7c6ac7e078482fd26e0d91fd60ee340d7d","observation_id":"e8d44e11-8681-431d-96d7-ce1af7527778","resolution":{"observed_at":"2026-05-17T12:55:41.705527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2012.15156","last_updated":"2020-12-30T13:46:06Z","snapshot_observed_at":"2026-08-16T18:55:14.879713Z","submitted_at":"2020-12-30T13:46:06Z","title":"A Memory Efficient Baseline for Open Domain Question Answering","version":1},"cited_work":{"arxiv_id":"2012.15156","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2012.15156","snapshot_observed_at":"2026-07-02T01:16:24.628753Z","title":"Izacard, F","venue":null,"work_id":"51472909-89b1-4282-8c27-f31a32db690a","year":2018},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2012.15156","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:51688eac0564f81d99855641f958512ae6258e67e5d7315a200c6cb55faf4663","observation_id":"1863d175-9ab3-4eba-be6e-2487bf289a53","resolution":{"observed_at":"2026-05-17T12:55:41.625899Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bba8edec-f054-4cb8-a4a0-6467fc69b07f","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:d614935dc170bf79c8d5c04f9694292f09bd1335e1c77669dc1345c7f14a6ae6","observation_id":"7204589b-c1b1-4d08-ad0e-242d36a26d5d","resolution":{"observed_at":"2026-05-17T12:55:41.708848Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1602.02410","last_updated":"2016-02-11T23:01:48Z","snapshot_observed_at":"2026-08-14T22:11:20.076826Z","submitted_at":"2016-02-07T19:11:17Z","title":"Exploring the Limits of Language Modeling","version":2},"cited_work":{"arxiv_id":"1602.02410","doi":"10.48550/arxiv.1602.02410","metadata_source":"pith","pith_arxiv_id":"1602.02410","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Exploring the Limits of Language Modeling","venue":"cs.CL","work_id":"a9dbcb7a-e48d-42a4-8d60-a8f723751a97","year":2016},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/1602.02410","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:5fde14e4fd60d307ece8bc038e915bf306e97316705d56c434934ed66c94cfe4","observation_id":"c855c087-6def-4fe8-8b1c-3834bc833b2b","resolution":{"observed_at":"2026-05-17T12:55:41.653639Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-08-13T17:41:53.092611Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":"2001.08361","doi":"10.1145/3616855.3635845","metadata_source":"pith","pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Scaling Laws for Neural Language Models","venue":"cs.LG","work_id":"b7dd8749-9c45-4977-ab9b-64478dce1ae8","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:add1b4d6ff15c21e3117196523884c7c4a4656c28f77874db809a85cd4d30d51","observation_id":"37117074-fdfb-4ed7-a5a5-1b7908bb911b","resolution":{"observed_at":"2026-05-17T12:55:41.659390Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Karpukhin, B","venue":null,"work_id":"310c90df-caae-4495-b473-32385af168c9","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c48314a3f11cbaaa31e0fd727ebaa93bf1cbf963ad96a3fb724a36941e893ab5","observation_id":"a98bbd05-9205-4c1b-8e1e-651724bebcc4","resolution":{"observed_at":"2026-05-17T12:55:41.711743Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Khandelwal, O","venue":null,"work_id":"78c3a1ba-97aa-4854-a0b8-e01adb5a6024","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a8e047ad5601ad09077aa6b4cf6ce16848d001e5f68b7da7d4c3f97c0a707b42","observation_id":"f7640b05-536b-469a-a695-b602b0c0d530","resolution":{"observed_at":"2026-05-17T12:55:41.714685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.07566","last_updated":"2021-07-15T19:00:35Z","snapshot_observed_at":"2026-08-19T16:39:10.077701Z","submitted_at":"2021-07-15T19:00:35Z","title":"Internet-Augmented Dialogue Generation","version":1},"cited_work":{"arxiv_id":"2107.07566","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2107.07566","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Internet-augmented dialogue generation","venue":null,"work_id":"31bc19be-de78-405f-ad70-e800049032ad","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2107.07566","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:37bd2d54c6abf99467b9026a0b767ca0706a452e87d2a3950d5b6d696eac35d9","observation_id":"d4423ffa-dde2-469c-a279-7f2a7e572dd3","resolution":{"observed_at":"2026-05-17T12:55:41.618848Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Kwiatkowski, J","venue":null,"work_id":"2124a4f7-cec2-4308-8bce-43cf5c1c37ae","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:976603162e44bfd52a0194005d6f982221b3c44a6edbc78ae71dfa041dc50f12","observation_id":"e3ef6836-19eb-4ca7-a612-5c68fc31ef76","resolution":{"observed_at":"2026-05-17T12:55:41.717670Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2102.01951","last_updated":"2021-10-26T15:47:43Z","snapshot_observed_at":"2026-08-19T16:31:50.731597Z","submitted_at":"2021-02-03T09:01:49Z","title":"Mind the Gap: Assessing Temporal Generalization in Neural Language Models","version":2},"cited_work":{"arxiv_id":"2102.01951","doi":"10.48550/arxiv.2102.01951","metadata_source":"arxiv_reference","pith_arxiv_id":"2102.01951","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Lazaridou, A","venue":"arXiv (Cornell University)","work_id":"093d53a0-17af-4539-9867-494ea4a7adab","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2102.01951","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:b22e99c4f6cf6a7f3a9cf1b2a8566c5526407b546da640abc915cecec0bd07b0","observation_id":"a88e9353-71d8-40fb-bc89-4757123accaf","resolution":{"observed_at":"2026-05-17T12:55:41.630982Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1906.00300","last_updated":"2019-06-27T21:06:12Z","snapshot_observed_at":"2026-08-16T14:19:32.455632Z","submitted_at":"2019-06-01T22:02:39Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","version":3},"cited_work":{"arxiv_id":"1906.00300","doi":null,"metadata_source":"pith","pith_arxiv_id":"1906.00300","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Latent Retrieval for Weakly Supervised Open Domain Question Answering","venue":"cs.CL","work_id":"8890f2d3-e454-453e-a19f-6b2a23b6c2c4","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/1906.00300","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:9281e37a4368cc514bf4ad898873455e629ae076e99cf1785dc699a7ac9ed26f","observation_id":"30ed8993-b036-4d07-a819-a5690dcde45c","resolution":{"observed_at":"2026-05-17T12:55:41.637050Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2107.06499","last_updated":"2022-03-24T19:29:45Z","snapshot_observed_at":"2026-08-14T07:55:03.346803Z","submitted_at":"2021-07-14T06:06:52Z","title":"Deduplicating Training Data Makes Language Models Better","version":2},"cited_work":{"arxiv_id":"2107.06499","doi":null,"metadata_source":"pith","pith_arxiv_id":"2107.06499","snapshot_observed_at":"2026-07-09T03:05:54.907820Z","title":"Deduplicating Training Data Makes Language Models Better","venue":"cs.CL","work_id":"7b9b24f2-6013-4e4a-be6b-ce3aeef64aa8","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2107.06499","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:e82b6a385d82a8355d452392f56da635946a964cd2d3ab73e124e9f7eecf1dfb","observation_id":"6f6b2f6f-430b-4c3f-a2c0-4cd9358907c8","resolution":{"observed_at":"2026-05-17T12:55:41.642631Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"u ttler, M. Lewis, W.-t. Yih, T. Rockt\\","venue":null,"work_id":"915bb4aa-db62-40aa-b925-5e6e2d8be749","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a86f1f1d116d3c4da052051cb5a9c406da8a8fdc4150e2179abbff677b7ef72b","observation_id":"84fc3d10-75d9-4372-9d71-13464e006cd1","resolution":{"observed_at":"2026-05-17T12:55:41.720729Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lewis, P","venue":null,"work_id":"efb61a76-cc9b-4e15-ba4e-c54ba9a6e943","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:3181233eba1111bf37e4a76035af6116b7f4d9a577f031d430cf4b12778e6e5f","observation_id":"545b46fc-2f09-41ef-af21-cce78c46fa17","resolution":{"observed_at":"2026-05-17T12:55:41.723435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Lieber, O","venue":null,"work_id":"76d9684b-ff60-4222-bab6-0d2bc0785f83","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:9cc03e9669463b0767d29f1284b106670209903e09bd8ad7eec9fbc1011cc0ae","observation_id":"51ac2658-0386-4feb-9c11-5f7797473a44","resolution":{"observed_at":"2026-05-17T12:55:41.726235Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Loshchilov and F","venue":null,"work_id":"cbb9f9fc-11dc-4894-9c43-802570593526","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:6aecc33a66d0ffe925d436db9a825c7d452448f525c945b1720aa2bda06c38f9","observation_id":"380f523b-75ad-406b-8f5d-8732196429fc","resolution":{"observed_at":"2026-05-17T12:55:41.729090Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Merity, C","venue":null,"work_id":"845d8cea-941d-4cba-9d03-e0da0828c265","year":2017},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:cea8302eceb6649d55a085137df27c7281ef0f83be4d6c092c6729617da40d3b","observation_id":"20d366a7-a81b-4452-87b7-575f7949faf1","resolution":{"observed_at":"2026-05-17T12:55:41.732207Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Mikolov, M","venue":null,"work_id":"c37c498d-d2cf-4430-8e79-ff64b0ede23a","year":2010},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:fc99f29fb2feecd2dee1ff38b77da58b4b9441d2cf09ca605c36201952c39523","observation_id":"19de9b6d-d874-4c22-be3c-1614f6e5ed52","resolution":{"observed_at":"2026-05-17T12:55:41.734963Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Paperno, G","venue":null,"work_id":"fd320dab-8b96-4b18-b366-465701f3226f","year":2016},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:3fac41130ae094168f90e095d5f0e2b14bd6e6646e3114536a9f67174258518d","observation_id":"27a8e37a-6127-4fab-bcbf-309103b8b16a","resolution":{"observed_at":"2026-05-17T12:55:41.737492Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Radford, J","venue":null,"work_id":"63cd1b55-58e4-4f40-bb89-582c4b01d9a7","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:0f06768d4c93fa522525486fe62682454b6afdfeaf60357f1966dbd4d4e462cf","observation_id":"cd124ac7-2026-48a9-b3b6-19a42d35425b","resolution":{"observed_at":"2026-05-17T12:55:41.740086Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fad1ee54-9cbd-44ac-9107-35a819b72781","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:3093da4a591fec169c73adc3bff0313a4295f6ff545b3f352bbd072e97b383e6","observation_id":"88a3351f-6d11-4f49-8e2b-5a10c2d7c099","resolution":{"observed_at":"2026-05-17T12:55:41.742694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Raffel, N","venue":null,"work_id":"d1be80b1-c4e4-4d2a-8998-5bfa65379928","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:372ea8d45a823ff5642cdba792f7bf877f14d41613c33a97f88978538ad884e0","observation_id":"f62c0741-d427-416b-8543-393f761f90e3","resolution":{"observed_at":"2026-05-17T12:55:41.745512Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Rajbhandari, J","venue":null,"work_id":"4ce41783-5d2a-4805-ab76-5d6cf7f5743c","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c09b45f3f035b00f4e1bf04dce677fd5f172ea33f16cf65212b9ac94df6aebb3","observation_id":"f8b01201-d712-4c72-82e0-fe4f0abdac7d","resolution":{"observed_at":"2026-05-17T12:55:41.748173Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Robertson and H","venue":null,"work_id":"e66a3939-65db-49ef-9902-f2a65cca849f","year":2009},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2119dd516ef99cc78f9a93a900b0f76d19dc0750118a9771b546dbe432bea427","observation_id":"6535a0cb-a9fc-4f01-a725-e5bdb02cf6d7","resolution":{"observed_at":"2026-05-17T12:55:41.751435Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Schwartz, J","venue":null,"work_id":"cf1ba49b-3e15-403d-8201-56e52e0914c1","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:4c5834381f43e31a3a2de655bce971513975a388996adf46595b031b50597aff","observation_id":"13fb1e87-9752-4abc-80b8-48be0335a53d","resolution":{"observed_at":"2026-05-17T12:55:41.754000Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1909.08053","last_updated":"2020-03-13T23:45:18Z","snapshot_observed_at":"2026-08-12T10:50:46.357243Z","submitted_at":"2019-09-17T19:42:54Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","version":4},"cited_work":{"arxiv_id":"1909.08053","doi":"10.48550/arxiv.1909.08053","metadata_source":"pith","pith_arxiv_id":"1909.08053","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Megatron-LM: Training Multi-Billion Parameter Language Models Using Model Parallelism","venue":"cs.CL","work_id":"c888e6d1-0b1d-43d6-9ef5-f0912a0efa1b","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":52,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/1909.08053","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:29ce8a07a099b66400b6d84a4ba9bb25f0b7c32fab1841cb63f556721d640834","observation_id":"aa35fa9b-c5ea-475f-84da-285eec412023","resolution":{"observed_at":"2026-05-17T12:55:41.678018Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-09T10:48:33.392193+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Strubell, A","venue":null,"work_id":"ae7a1452-1ba6-4ae7-9bb3-4702e8dd82c6","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":54,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:096b93260ce1069327821d8444393e7a7f0e14a06059155428ce39e4b5c46516","observation_id":"92b7653c-bdd7-41be-9ca4-f91c49e2569a","resolution":{"observed_at":"2026-05-17T12:55:41.756581Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Vaswani, N","venue":null,"work_id":"3e7a3d4e-a576-4da0-8d22-1859489962f9","year":2017},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":55,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:f440aeba808ba4b7ca0b65c0dc77d6afbff85f58d21f460ff4429e85f08f981c","observation_id":"a4961f97-f6a9-484e-bb56-f04747104f6d","resolution":{"observed_at":"2026-05-17T12:55:41.759089Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"8170.11482","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T11:16:53.964427Z","title":"Wei and W","venue":null,"work_id":"1f34cb5a-109d-4300-b866-b1bf1c835ef7","year":2006},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":56,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:35be440c427d6a48ef139bda9f811d28f851e348132f67de2f5f1a7d3cb2596d","observation_id":"a815d16e-266c-46e1-ba19-f4897c8d4a4c","resolution":{"observed_at":"2026-05-17T12:55:41.702546Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Weidinger, I","venue":null,"work_id":"080d3859-7996-4872-a9a4-000665858d42","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":57,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:af7f08785c6e41b038f99dd0c70baed2b0716a9fde6ae2bb7a5bea9d2b4c3e60","observation_id":"1405bc01-1a53-432b-a160-0fed43fdc653","resolution":{"observed_at":"2026-05-17T12:55:41.763682Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Yogatama, C","venue":null,"work_id":"964a6b9b-42a2-4fcb-8b54-d31ff9cf12ed","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":58,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:854af9b64dfcfb1b5d4689248b79ea5ce26cb1377b5a51ad3a44ff935adca164","observation_id":"fa5346a4-c3a9-467b-9cfd-e90081a304ea","resolution":{"observed_at":"2026-05-17T12:55:41.767366Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang and R","venue":null,"work_id":"05b8a252-45fc-4705-af0c-f1a684912ee9","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":59,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:e58c0d5bc3729f1a4914ca7db8547900746a628455610bd6c74251262e9d1cd8","observation_id":"cdea33dd-8f9b-4d0f-a381-e95ee051ab20","resolution":{"observed_at":"2026-05-17T12:55:41.769918Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Zhang, M","venue":null,"work_id":"203c48bf-5543-459c-ba0c-d7619b08017b","year":2018},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":60,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:fde0e392ae0ec6dc49710a0f65ededf24cdc0cd0348b945218d890902eb06d01","observation_id":"43e3703d-ad5c-4b50-ab25-871eab384aea","resolution":{"observed_at":"2026-05-17T12:55:41.772801Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8cba78d7-2be7-4fe1-90ea-e57c46aa1e0e","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":61,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c919ebbcd94db33174c32391fc742b85524a558d072fc13bfbe80985073d2257","observation_id":"d5126483-f318-496a-8eb2-1950a2f20901","resolution":{"observed_at":"2026-05-17T12:55:41.775744Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , url =","venue":null,"work_id":"2e7fcd44-c8bb-4f28-950f-95106eaf2ba0","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":62,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:0b5c9f9d1720f3ad7459f71c4bd29d07ca9080cdda87e72c43d3ab3302b85949","observation_id":"18b22e0b-0af5-47ab-8869-f99ebf2b12f5","resolution":{"observed_at":"2026-05-17T12:55:41.779021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , url =","venue":null,"work_id":"7ae7b678-92a2-486d-9a5d-4206e8c824a0","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":63,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2ad1f4c57562ce7f749ec237e43bf5c7c613a9db30737f62e884465036a2a869","observation_id":"571823ca-7ab5-4a32-821a-12906b681dae","resolution":{"observed_at":"2026-05-17T12:55:41.781852Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"cbb38397-f510-4462-b2af-e2da1f416ec2","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":64,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:eeb6da84c03f69cd93ebab99be7f88493bf0b1c43bbb537c06cae38cafea97a2","observation_id":"a35ea506-60ca-44ea-a60c-3f8d81fd5c12","resolution":{"observed_at":"2026-05-17T12:55:41.784721Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Ng, Andrew Y","venue":null,"work_id":"b750882d-b1e6-4269-8425-e5392b9b6b4c","year":2003},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":65,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2e3e084f1eacde3bd7fe4210d2bd958dce812116c7ae46376b1c4f34e30b38eb","observation_id":"74092900-f2d0-4002-a439-c87f16176105","resolution":{"observed_at":"2026-05-17T12:55:41.787334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Advances in Neural Information Processing Systems , url =","venue":null,"work_id":"158eb130-9076-4aa4-9890-0a5dd46aaadf","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":66,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:d0b9f05729b7289c0fd5769d721e46cbd10fdeceb28b4a1bf9945df664f332cd","observation_id":"4e534e62-43be-4818-8d26-3048577b86a9","resolution":{"observed_at":"2026-05-17T12:55:41.790171Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Journal of Machine Learning Research , volume = 21, number = 140, pages =","venue":null,"work_id":"fb06ddd8-fab1-4313-b52c-a8a2d63a0c2d","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":67,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:eb49b98c94db793c3b5109bbc69a714de27da1a08ec3be9f5f7814108ad54b48","observation_id":"d02a535b-0468-4744-8633-ca36ce2b6c60","resolution":{"observed_at":"2026-05-17T12:55:41.793710Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f227ea12-dc18-40f0-b383-98c88c85365b","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":68,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:7924d7552ea0646463789cde0950f97f17d3e404607c0e63e17ee7497af19dae","observation_id":"da292220-b31e-4b70-8e24-6d9c28b6b804","resolution":{"observed_at":"2026-05-17T12:55:41.796909Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"38a34286-733d-4ec4-bbbb-ee21de15f8e6","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":69,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:6316a11aecbdd5dfff7336e7eafc556dffb2cf513413818330ca69d2a96bcfeb","observation_id":"9d7e0a2d-5fc4-4772-8ecc-644f3772c020","resolution":{"observed_at":"2026-05-17T12:55:41.799750Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Transformer-","venue":null,"work_id":"e22bf996-592d-40c6-b137-c888c62fbb27","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":70,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:51ae1b8fe620b0e0b14ce10fc15c29b874388e0ccbe88a17e79324faf6ea0a29","observation_id":"3d2ae18f-b459-4f07-a8ee-c6fa76c09fe7","resolution":{"observed_at":"2026-05-17T12:55:41.802644Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"dc615ca2-ac03-41c8-92a9-f7701976b5ce","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":71,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:571b969225714360345696e1c269459f6945caf1a173ce72dabfd45651b6bfd8","observation_id":"7f5a03e4-3b69-47b7-a0ad-9bc8e1fb5dc2","resolution":{"observed_at":"2026-05-17T12:55:41.805421Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , url =","venue":null,"work_id":"0243cc9e-5597-4871-8128-3d802f52dd4f","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":72,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2cdadb6c32fcacd11a23b574f71b2e12cb26fa961d682f0ab8093b58acf3b09c","observation_id":"0cf644e6-9efe-46dc-97a2-c1ee7bdb0394","resolution":{"observed_at":"2026-05-17T12:55:41.808401Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8c24c90e-d169-4b25-8451-c5fdbd47e2f6","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":73,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:48e8667d91c79c798e4002439a4f8fa0a155f3ed7ce248296fa4ca175b611199","observation_id":"ea1a622a-0af6-4102-a54b-1d7fcdbcdcff","resolution":{"observed_at":"2026-05-17T12:55:41.811080Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"year = 2020, month = nov, booktitle =","venue":null,"work_id":"23cee7e3-a207-4ec2-a338-12c08417d804","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":74,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a054b5beb7a02f4ae89bc60ab08c91cd70df008c20651a642121f73d7e5d04c9","observation_id":"27ec570c-bdfd-4048-8893-349299ef1c19","resolution":{"observed_at":"2026-05-17T12:55:41.813900Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"bef34053-9dc5-4fea-9ac3-3ab23f6321e6","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":75,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:f83d7041bc5c6eb7e20a0a1dc957adb8c01e35d382f5c524a846691a15fb360f","observation_id":"b2bf7c94-5ef8-47e4-a74a-af785034f3a5","resolution":{"observed_at":"2026-05-17T12:55:41.816570Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"951eeea4-c3ce-4719-978a-056efb9e0d4c","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":76,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:8f6abf412c936f5d0d4631e3a7944414090fb374d37b1782ea4bdca575f334e2","observation_id":"d0479a37-56eb-440d-b688-de204bed7a5e","resolution":{"observed_at":"2026-05-17T12:55:41.819235Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Machine Learning , url =","venue":null,"work_id":"6a3bb3cd-8062-4aaa-b1fa-e905e85ce29d","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":77,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:ff322fab9ec3710f52de35d58630e55a6f4f31eb75c224973802fe2354578396","observation_id":"2592487e-b253-4dea-b5a3-097aec89a270","resolution":{"observed_at":"2026-05-17T12:55:41.821955Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fdc6ce92-7996-4f6c-bb1a-7dd8712929b1","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":78,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:7d61dac3050a7077dce2db72a909048cb31210d9168cc5b18c2fdbdaed92e5b8","observation_id":"f69c5165-8d8d-4cf2-b822-57f469831d66","resolution":{"observed_at":"2026-05-17T12:55:41.824550Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , url =","venue":null,"work_id":"b4d722c7-6e8d-4d62-865a-c631d2d5c21e","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":79,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:53144191f0dce493e10e2d07f352a10b00ef377eea5a0d6b426681b0341ca1cc","observation_id":"9f55b794-2591-4591-90de-b18089a1e716","resolution":{"observed_at":"2026-05-17T12:55:41.827253Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference of the European Chapter of the Association for Computational Linguistics , url =","venue":null,"work_id":"4e787e23-16c0-489d-9b74-75be28364dad","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":80,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:b88e8655e9ea9f0c29016b4872abe469e774382e59c3bb21237cc76f22dfa3a2","observation_id":"e73af228-773c-4d20-ba28-83c2ef6e8e08","resolution":{"observed_at":"2026-05-17T12:55:41.830242Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"883e4799-6c3f-4d9d-852c-e6d391bb0fb3","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":81,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c39f847946d4d8e037b3338c3972df404a8000aaa20e8e9f3b5817f518839841","observation_id":"902458cd-0e81-4901-a173-ee22d6b362f5","resolution":{"observed_at":"2026-05-17T12:55:41.832694Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Scaling Language Models: Methods, Analysis & Insights from Training","venue":null,"work_id":"3aa53e1a-c10d-4bf5-a1a1-2262eefc96f2","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":82,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c70fa26a0bd0bf918324be8cba2eb76dce77e4ec0b911e90bccbfe8d46c5ec8c","observation_id":"2c3c468d-e825-4342-a01e-4cd6bf00e39b","resolution":{"observed_at":"2026-05-17T12:55:41.835499Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"19087199-fe84-44e6-88de-1cc337c1c8a6","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":83,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:4f881f2b1d4194b840509366940f9357770b25c00c7d124a7a32032fc4688ecf","observation_id":"d171f817-46c4-4b11-a189-00062607c38d","resolution":{"observed_at":"2026-05-17T12:55:41.838504Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"CoRR , url =","venue":null,"work_id":"351ff06d-2388-4ae3-8d03-ec34dcfe73d4","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":84,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:014339dbce5e461eb4a95c200faf9a466f3191f61c93f6e3c5a00d8b65241192","observation_id":"d2f9afff-c185-4312-b2eb-3c07a4dfc36b","resolution":{"observed_at":"2026-05-17T12:55:41.841271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"37fce125-08d5-4590-a1a2-3078dfbe58a1","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":85,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:a215e1935c1d8c47130809374e01b07d4dc188cf4f8082b23a8cba521406ccf4","observation_id":"f3d36c21-f9dc-4c4d-8556-79396f21179c","resolution":{"observed_at":"2026-05-17T12:55:41.843837Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference on Empirical Methods in Natural Language Processing , url =","venue":null,"work_id":"28db168d-7dc8-4c98-931c-31e15edd91cf","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":86,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:c16dad4c7b42d6aec974fc1f98c9acabd6e004cb8432f1902dd0f834cc87c431","observation_id":"756dbb45-2397-405a-9370-f6cf58dc5490","resolution":{"observed_at":"2026-05-17T12:55:41.846711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"8a376588-15a0-4fbe-a1c8-e22acd26c5b9","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":87,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2feec8b2fc55e35476d4d7d3af589f0389d8bef245ab3136831c50fe711165bf","observation_id":"6c5b416b-7c19-4e54-9d3c-d525cea5da9c","resolution":{"observed_at":"2026-05-17T12:55:41.849488Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"9e590fe0-824c-4c90-857c-093c48a18112","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":88,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:4ffb5ad0c54c26acfb335bdb733ed9664d3a2cfd0c4d99aa13214e0c1d7b1c0d","observation_id":"bbd0eadb-b653-476a-b4da-7ca384a3e325","resolution":{"observed_at":"2026-05-17T12:55:41.852183Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7369aaa1-4c98-48a2-a2c4-bb3f49cb518b","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":89,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:b8e3b02bbd91a15748b36fbbef80248275e1993cb41366c4ca9912ebd8b41b0f","observation_id":"976c7d44-04da-4821-8746-3565aa967826","resolution":{"observed_at":"2026-05-17T12:55:41.854705Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Retrieval-Augmented Generation for Knowledge-Intensive","venue":null,"work_id":"12a5e772-1794-4df5-bf39-b8811a0f5e97","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":90,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:6190c601321697e77500052d68418ffe7d1155efbda0ea644f1c8c49ea745952","observation_id":"80971e0c-d507-4597-b3e3-65f60048f6b9","resolution":{"observed_at":"2026-05-17T12:55:41.857521Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Conference of the European Chapter of the Association for Computational Linguistics , url =","venue":null,"work_id":"0e15ed6d-e435-4ace-a24f-cba68d87df18","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":91,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:69b52b3c438373c8b82e402d22314b210d4d300653dadf1a35f90706827057b1","observation_id":"57b06ec8-5743-4864-91ae-4217e9b5703f","resolution":{"observed_at":"2026-05-17T12:55:41.860186Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"6e0c8b18-c53c-461a-852b-01c1433699f8","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":92,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:da16458bccace0dee1f2e12ccc457f820c8b9736d98659e0a1a496d960e9eff0","observation_id":"b57027e3-9b95-455a-96ab-d35a430db2f7","resolution":{"observed_at":"2026-05-17T12:55:41.863651Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"author =","venue":null,"work_id":"b6b34aad-63b5-4cc9-b9f1-bb759a27427f","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":93,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:493940b222df02966207b720638648f28f657a19b1db63fde90b8febb326f7ef","observation_id":"513f6df8-9d19-42f1-af83-16c39b053c4e","resolution":{"observed_at":"2026-05-17T12:55:41.867046Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Megatron-","venue":null,"work_id":"c5e1ee6f-2e53-48ae-ba7e-ef8ef1d92a60","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":94,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:792ecdee4cf56e210b24cbf8c9553dec050e25353b0dab2087166d12249d3cd3","observation_id":"69401f42-e5af-4d9c-8486-478ffaef8cad","resolution":{"observed_at":"2026-05-17T12:55:41.870035Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"f96b2ee8-8f2a-40c1-9e6c-c10839904b19","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":95,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:4e5836aacf1299330403a564e07e0b4de3cc048698c36fb044f3d90cd5aba931","observation_id":"93486146-da72-4e1a-a45a-408f31a21cb9","resolution":{"observed_at":"2026-05-17T12:55:41.872641Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"7df0f9d5-c102-470c-9afb-f0087baaa25d","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":96,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:3f53dd0b4efe5a957165c92a14b659fab70ebf0db078aaf5325ab7622015309c","observation_id":"8f474116-d751-4211-b611-8b8fccafc25e","resolution":{"observed_at":"2026-05-17T12:55:41.875257Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"48cfaec1-f496-481f-ab96-61f6834934a2","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":97,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:2281aa6e7381ce598dc6687c0d38fd0c801c9c6e29f9a9f8902ee2240c01c35b","observation_id":"a71e78b8-3daa-45fa-a6f0-181c0adf43a1","resolution":{"observed_at":"2026-05-17T12:55:41.880331Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"fb0d1029-900e-46d2-85ba-6cea78765ba1","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":98,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:e1c0c86d6aaa20756c6deb35b81f1c1d6dadc1dcf8073049851b51bd3dcd712f","observation_id":"0109c2fc-df51-46bd-b9ef-4965682656d8","resolution":{"observed_at":"2026-05-17T12:55:41.882946Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"The Probabilistic Relevance Framework","venue":null,"work_id":"0adf03f2-a253-4856-8566-0c6781169cd7","year":2009},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":99,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:5bd43ea4bed4b53a2dfe3e14292dda9c736030eaa5a04b2d2d6d1f521f84e9dd","observation_id":"606b24af-9e96-40ae-a6ed-2d7f39ea49ea","resolution":{"observed_at":"2026-05-17T12:55:41.885527Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"and Etzioni, Oren , year = 2020, month = nov, journal =","venue":null,"work_id":"345a89ca-4934-4084-ad9f-d33b0be2ca4b","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":100,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:ac753123d1b61f18f0152b731e70a0632bafa0fd5c9c0e6f0ca4bf77f3f79934","observation_id":"7b60ddec-e3ef-4f91-8605-c9e36c2e825f","resolution":{"observed_at":"2026-05-17T12:55:41.888352Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.07567","last_updated":"2021-04-15T16:24:43Z","snapshot_observed_at":"2026-08-18T13:14:17.879046Z","submitted_at":"2021-04-15T16:24:43Z","title":"Retrieval Augmentation Reduces Hallucination in Conversation","version":1},"cited_work":{"arxiv_id":"2104.07567","doi":"10.48550/arxiv.2104.07567","metadata_source":"arxiv_reference","pith_arxiv_id":"2104.07567","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Retrieval augmentation reduces hallucination in conversation","venue":"arXiv (Cornell University)","work_id":"764f4422-9533-439b-857b-07eab22d3719","year":2021},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":101,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"cited_paper":"/paper/2104.07567","citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:18a3aff550a1724bb6dfe719c9d15ddfd417eb2bea4017c482c634212b6cd72a","observation_id":"3a17acd6-80ca-4bec-8c5b-76c9993d51b0","resolution":{"observed_at":"2026-05-17T12:55:41.672650Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"International Conference on Learning Representations , url =","venue":null,"work_id":"17f68308-7669-41b9-a898-fa72eb431125","year":null},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":102,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:5c47d1d8f3008ba01cd12302750d51741416f2aa1d4767c3fde1c3e5e677dad8","observation_id":"b23f8372-35db-4e3a-a678-0a75ea0ee10d","resolution":{"observed_at":"2026-05-17T12:55:41.891052Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Energy and Policy Considerations for Deep Learning in","venue":null,"work_id":"f7d04434-56fb-465d-a64f-70bfc3dd2efe","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":103,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:fe3f49e5820eccbb50f1dfe33e72622ee8238fa36091f957d1e8f776d67e91c0","observation_id":"ba3cf91a-04be-43cc-ab79-49d79abe60f9","resolution":{"observed_at":"2026-05-17T12:55:41.893821Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Popat and Peng Xu and Franz J","venue":null,"work_id":"64206415-17eb-47c1-ab6c-2825eef1cd4b","year":2007},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":104,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:3590f468cc5b4a9fe04cd7d5eb4b4e4ea7dd218c1bb5a421988952286613e1fb","observation_id":"dc4a63bd-3799-4820-b150-d37a61332aa9","resolution":{"observed_at":"2026-05-17T12:55:41.898651Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":null,"venue":null,"work_id":"335ccb7d-90a4-402d-b4df-02b0f99cca22","year":2020},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":105,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:25dcff4a2f37e124184aa1ee4ef3d3ad7560df92c70dad4dcc6055c3afad5ce5","observation_id":"85d12781-abe0-4d14-9519-3e69df4d9a07","resolution":{"observed_at":"2026-05-17T12:55:41.901392Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Toutanova and Llion Jones and Ming-Wei Chang and Andrew Dai and Jakob Uszkoreit and Quoc Le and Slav Petrov , year = 2019, journal =","venue":null,"work_id":"775117a0-4388-4e2c-a414-91a47df1ca07","year":2019},"citing_paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens","version":3},"reference_index":106,"source":"arxiv_source","source_observed_at":"2026-05-17T12:55:41.551478Z"},"links":{"citing_paper":"/paper/2112.04426"},"observation_digest":"sha256:7649fec4bcdd7488ccc9d217fe5b429928c73589a584c604acf88f7313846448","observation_id":"18e662c8-9dfe-4f9e-b086-87755d38c552","resolution":{"observed_at":"2026-05-17T12:55:41.904296Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-23T06:30:58.430688+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2112.04426","last_updated":"2022-02-07T21:07:59Z","latest_version":3,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-12T09:04:15.292379Z","submitted_at":"2021-12-08T17:32:34Z","title":"Improving language models by retrieving from trillions of tokens"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":2,"parse_uncertain":0,"unresolved":28,"verified_exact":11,"verified_fuzzy":59},"total_outbound_references":115},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-23T06:30:58.430688+00:00","source":"crossref"},{"observed_at":"2026-08-23T06:30:53.778098+00:00","source":"retraction_watch"}],"thesis":"As of 23 August 2026, this Paper Citation Record lists 100 of 115 outbound references and 61 inbound Pith citation observations for arXiv:2112.04426."}