{"as_of":"2026-08-08T09:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8f870c85aa9ac79dded7171ba5ff1f7362058522cbadca59ad140d34e4d00d21","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T15:39:41.455438Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.11889/citation-record","integrity":"/paper/2607.11889/integrity","json":"/paper/2607.11889/citation-record.json","paper":"/paper/2607.11889"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2002.09018","last_updated":"2021-03-05T06:29:48Z","snapshot_observed_at":"2026-08-03T21:55:15.856477Z","submitted_at":"2020-02-20T20:51:33Z","title":"Scalable Second Order Optimization for Deep Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2002.09018","snapshot_observed_at":"2026-08-02T15:39:35.216361Z","title":"Scalable second order optimization for deep learning.arXiv:2002.09018,","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:35.216361Z"},"links":{"cited_paper":"/paper/2002.09018","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:99989c49056a5825f2ca716d59fd97245ba3e63513df70bc4710f2ac0352d0ba","observation_id":"cb6ad59f-2a92-4ec4-bd20-3a38d758c01c","resolution":{"observed_at":"2026-08-02T15:39:35.216361Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.02954","last_updated":"2024-01-05T18:59:13Z","snapshot_observed_at":"2026-08-02T13:11:16.882565Z","submitted_at":"2024-01-05T18:59:13Z","title":"DeepSeek LLM: Scaling Open-Source Language Models with Longtermism","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.02954","snapshot_observed_at":"2026-08-02T15:39:35.573004Z","title":"Deepseek llm: Scaling open-source language models with longtermism.arXiv:2401.02954,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:35.573004Z"},"links":{"cited_paper":"/paper/2401.02954","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:11a2a7d993557852ad55be7e101fe0a9dd1ee20781fcd821666c7333353a3793","observation_id":"9647fff0-760b-4d3f-8553-4e43a915f84f","resolution":{"observed_at":"2026-08-02T15:39:35.573004Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09673","last_updated":"2024-09-20T21:21:56Z","snapshot_observed_at":"2026-08-04T07:20:49.662052Z","submitted_at":"2024-05-15T19:27:45Z","title":"LoRA Learns Less and Forgets Less","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.09673","snapshot_observed_at":"2026-08-02T15:39:35.740336Z","title":"Lora learns less and forgets less.arXiv:2405.09673,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:35.740336Z"},"links":{"cited_paper":"/paper/2405.09673","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:ac828939b4e0f33ed58b17d0aa3d8932facb7343151343d9aa7e76fc942ada78","observation_id":"3f3a08d2-b253-441f-ba5d-719e68bbfe60","resolution":{"observed_at":"2026-08-02T15:39:35.740336Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.04166","last_updated":"2023-02-13T16:19:05Z","snapshot_observed_at":"2026-08-05T08:58:00.258106Z","submitted_at":"2023-02-08T16:17:29Z","title":"GPTScore: Evaluate as You Desire","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.04166","snapshot_observed_at":"2026-08-02T15:39:36.603425Z","title":"Gptscore: Evaluate as you desire","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.603425Z"},"links":{"cited_paper":"/paper/2302.04166","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:9416eb407e7926aadeab547297c19f1e830461e4ff6384d52af7beba462ecdd6","observation_id":"ab636576-8d04-4099-b7ec-d50e2f1669bd","resolution":{"observed_at":"2026-08-02T15:39:36.603425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.12009","last_updated":"2019-07-28T03:57:41Z","snapshot_observed_at":"2026-07-06T08:10:42.792778Z","submitted_at":"2019-07-28T03:57:41Z","title":"Representation Degeneration Problem in Training Natural Language Generation Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.12009","snapshot_observed_at":"2026-08-02T15:39:36.775680Z","title":"Representation degeneration problem in training natural language generation models.arXiv:1907.12009,","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.775680Z"},"links":{"cited_paper":"/paper/1907.12009","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:eee45a590387ba0f224b80a01de9260a5cdebeea775a4b6387bd8f0c60a03102","observation_id":"13d42076-af85-40c8-ab8b-de368453724b","resolution":{"observed_at":"2026-08-02T15:39:36.775680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00027","last_updated":"2020-12-31T19:00:10Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-12-31T19:00:10Z","title":"The Pile: An 800GB Dataset of Diverse Text for Language Modeling","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00027","snapshot_observed_at":"2026-08-02T15:39:36.899776Z","title":"The pile: An 800gb dataset of diverse text for language modeling.arXiv:2101.00027,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.899776Z"},"links":{"cited_paper":"/paper/2101.00027","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:99cff252c06eb36eb7869c48355523e1cb14746bb27bf00082d5653b3f42b501","observation_id":"82ad7db4-c7d2-42bf-9d2d-7108063ab95e","resolution":{"observed_at":"2026-08-02T15:39:36.899776Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17322","last_updated":"2023-09-29T15:30:32Z","snapshot_observed_at":"2026-08-05T03:22:28.843127Z","submitted_at":"2023-09-29T15:30:32Z","title":"Assessing Look-Ahead Bias in Stock Return Predictions Generated By GPT Sentiment Analysis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17322","snapshot_observed_at":"2026-08-02T15:39:37.048874Z","title":"Assessing look-ahead bias in stock return predictions generated by GPT sentiment analysis.arXiv:2309.17322,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.048874Z"},"links":{"cited_paper":"/paper/2309.17322","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:a15d1bfe7c195a0063533af076be3741f4a32d1420d56dd48ca72013708b2a37","observation_id":"62b7253c-cf4c-4b74-904b-323c4d3ddb86","resolution":{"observed_at":"2026-08-02T15:39:37.048874Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.04014","last_updated":"2023-09-06T23:13:07Z","snapshot_observed_at":"2026-07-06T16:03:42.855570Z","submitted_at":"2023-08-08T03:18:18Z","title":"Continual Pre-Training of Large Language Models: How to (re)warm your model?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.04014","snapshot_observed_at":"2026-08-02T15:39:37.195076Z","title":"Continual pre-training of large language models: How to (re) warm your model?arXiv:2308.04014,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.195076Z"},"links":{"cited_paper":"/paper/2308.04014","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:787367ac140d2eb50be85a8df13d0b2cf17aaa1c187694645c29e3101dd5bd3a","observation_id":"b510c958-6b20-475c-b8eb-991fa208eee5","resolution":{"observed_at":"2026-08-02T15:39:37.195076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.21206","last_updated":"2025-07-06T01:02:58Z","snapshot_observed_at":"2026-08-07T17:39:15.439590Z","submitted_at":"2025-02-28T16:25:50Z","title":"Chronologically Consistent Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.21206","snapshot_observed_at":"2026-08-02T15:39:37.463066Z","title":"Chronologically consistent large language models.arXiv:2502.21206, 2025a","venue":null,"work_id":null,"year":2010},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.463066Z"},"links":{"cited_paper":"/paper/2502.21206","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:9f120d280e54e631c24a34f10746f02dc3492c52e6947498f78d7b58432c6a44","observation_id":"a53751f2-49d5-4490-bef0-d7637f4e4c2d","resolution":{"observed_at":"2026-08-02T15:39:37.463066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-02T15:39:37.821671Z","title":"Jared Kaplan, Sam McCandlish, Tom Henighan, Tom B Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeffrey Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.821671Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:4564a892385201a6937b0b4f35f0410eae5fb94295556450085da282793adf80","observation_id":"827cc41d-17dd-44f8-850e-6a1002c4bfef","resolution":{"observed_at":"2026-08-02T15:39:37.821671Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.03241","last_updated":"2023-04-12T10:36:44Z","snapshot_observed_at":"2026-08-05T03:04:44.382109Z","submitted_at":"2023-02-07T03:57:55Z","title":"Continual Pre-training of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.03241","snapshot_observed_at":"2026-08-02T15:39:37.977391Z","title":"Continual pre-training of language models.arXiv:2302.03241,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.977391Z"},"links":{"cited_paper":"/paper/2302.03241","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:c2a8a4bb02638d2199bd71e2ef63987e5cf7255e252767ef632c32e0bc8dd251","observation_id":"a6e68a9f-f59c-4174-9689-4b9adf2fb501","resolution":{"observed_at":"2026-08-02T15:39:37.977391Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.10105","last_updated":"2024-04-14T01:15:31Z","snapshot_observed_at":"2026-07-06T16:20:13.025092Z","submitted_at":"2023-09-18T19:28:48Z","title":"Understanding Catastrophic Forgetting in Language Models via Implicit Inference","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.10105","snapshot_observed_at":"2026-08-02T15:39:38.128415Z","title":"Understanding catastrophic for- getting in language models via implicit inference.arXiv:2309.10105,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.128415Z"},"links":{"cited_paper":"/paper/2309.10105","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:c40c732d27d4cd35efec1b2ba96fa7509b198eec73f5c9532e44e4acdf7ed095","observation_id":"fa718e08-6813-4975-81cb-7350208e9b59","resolution":{"observed_at":"2026-08-02T15:39:38.128415Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-07-06T19:55:37.400185Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-02T15:39:38.255677Z","title":"Tulu 3: Pushing frontiers in open language model post-training.arXiv:2411.15124,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.255677Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:e78e8867b2be408604946eadab414bb43f123449c6e2fb83841559ccee809dda","observation_id":"53e34363-fa6c-48b0-9d03-cfd979299f22","resolution":{"observed_at":"2026-08-02T15:39:38.255677Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2602.04998","last_updated":"2026-05-19T00:07:35Z","snapshot_observed_at":"2026-08-04T11:18:43.351216Z","submitted_at":"2026-02-04T19:36:20Z","title":"Learning Rate Matters: Vanilla LoRA May Suffice for LLM Fine-tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2602.04998","snapshot_observed_at":"2026-08-02T15:39:38.407161Z","title":"Learning rate matters: Vanilla lora may suffice for llm fine-tuning.arXiv:2602.04998,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.407161Z"},"links":{"cited_paper":"/paper/2602.04998","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:16f1bf566b8a30e79f7d65afe0ecccf55e49355397f7febaa82719fa1eb56b95","observation_id":"4a83669e-bd95-4d7a-bf67-c65b80da2199","resolution":{"observed_at":"2026-08-02T15:39:38.407161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-02T15:39:38.560563Z","title":"17 Tianle Li, Wei-Lin Chiang, Evan Frick, Lisa Dunlap, Tianhao Wu, Banghua Zhu, Joseph E Gon- zalez, and Ion Stoica","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.560563Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:bd3f2375a233aebcaa02ff0c9d234285f7616c88f113ead26ac4b6fb485b1cc1","observation_id":"67cd5d86-b2b8-4b58-bc41-af628a67289c","resolution":{"observed_at":"2026-08-02T15:39:38.560563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.16634","last_updated":"2023-05-23T22:12:16Z","snapshot_observed_at":"2026-08-02T04:02:36.848064Z","submitted_at":"2023-03-29T12:46:54Z","title":"G-Eval: NLG Evaluation using GPT-4 with Better Human Alignment","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.16634","snapshot_observed_at":"2026-08-02T15:39:38.736078Z","title":"G-eval: Nlg evaluation using gpt-4 with better human alignment.arXiv:2303.16634, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.736078Z"},"links":{"cited_paper":"/paper/2303.16634","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:8a5caf876c1ae062285759164dcda58924ad1781223c9088d8b52829231e805d","observation_id":"231d62bb-421a-469e-b33c-a37d1f0f0f43","resolution":{"observed_at":"2026-08-02T15:39:38.736078Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-02T15:39:38.865459Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.865459Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:ba03a830aeeb28e0d9fc189d1797df4a700897b5d96277f6401725912cbe0d93","observation_id":"fa552c9a-bddf-4e73-9c47-9f22269e42f2","resolution":{"observed_at":"2026-08-02T15:39:38.865459Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:39:39.296106Z","title":"Lookahead bias in pretrained language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.296106Z"},"links":{"citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:1f9e42a1aac6d62febc6afbf3d9ec578d433289258955f1e099db3ca57c332d5","observation_id":"34512196-4827-4674-96a8-cb95e41436b2","resolution":{"observed_at":"2026-08-02T15:39:39.296106Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:39:39.477379Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.477379Z"},"links":{"citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:911a5202d008f87a6d47ce6d2d28dea87cbda261f99a5276a2dff5b00a0183dd","observation_id":"a4339ad7-c961-4d2c-b8d3-e476c273cedf","resolution":{"observed_at":"2026-08-02T15:39:39.477379Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-02T15:39:39.610087Z","title":"Gemma 3 technical report.arXiv:2503.19786,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.610087Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:6338abab77752c100858c89cd067ff167474fd5671b0c0222dc9fe424721c7db","observation_id":"29ba1025-8b9c-4bad-857f-43d089431b57","resolution":{"observed_at":"2026-08-02T15:39:39.610087Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2408.00118","last_updated":"2024-10-02T15:22:49Z","snapshot_observed_at":"2026-08-02T16:20:09.773989Z","submitted_at":"2024-07-31T19:13:07Z","title":"Gemma 2: Improving Open Language Models at a Practical Size","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.00118","snapshot_observed_at":"2026-08-02T15:39:39.750815Z","title":"Gemma 2: Improving open language models at a practical size","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.750815Z"},"links":{"cited_paper":"/paper/2408.00118","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:b08d4d79519b8addd8177244693645c9c339207de77b14a52c4d135a6b524b75","observation_id":"41a7b25e-e31e-446f-94bf-f4bb4ef046cd","resolution":{"observed_at":"2026-08-02T15:39:39.750815Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-02T15:39:39.888024Z","title":"Llama: Open and efficient foundation language models.arXiv:2302.13971,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.888024Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:a86a87576391bfcf850b0e808fc297d5dee7f51c0039695d837fad192dd157f3","observation_id":"ea430f53-6fc1-4c0e-8a0f-9a48d1842216","resolution":{"observed_at":"2026-08-02T15:39:39.888024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.17926","last_updated":"2023-08-30T13:22:35Z","snapshot_observed_at":"2026-08-08T03:32:23.667881Z","submitted_at":"2023-05-29T07:41:03Z","title":"Large Language Models are not Fair Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.17926","snapshot_observed_at":"2026-08-02T15:39:39.999546Z","title":"Large language models are not fair evaluators.arXiv:2305.17926,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.999546Z"},"links":{"cited_paper":"/paper/2305.17926","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:0cc43ed68ca13fa55c597ff4fe8e607d3f65c3a0b49eb8d99cce6d8885ca231a","observation_id":"87b7ff20-00ef-478a-bb84-90714660267a","resolution":{"observed_at":"2026-08-02T15:39:39.999546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-02T15:39:40.261000Z","title":"Zhao, Kelvin Guu, Adams Wei Yu, Brian Lester, Nan Du, Andrew M","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.261000Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:b184c89d1c8df8c40fc6aa9d89eb53d37b94780d917fdbd4fb154810b32e9d80","observation_id":"28d7413b-f8d4-4e07-af76-27c644bff19c","resolution":{"observed_at":"2026-08-02T15:39:40.261000Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08464","last_updated":"2024-10-07T01:45:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-12T17:52:30Z","title":"Magpie: Alignment Data Synthesis from Scratch by Prompting Aligned LLMs with Nothing","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08464","snapshot_observed_at":"2026-08-02T15:39:40.372812Z","title":"Magpie: Alignment data synthesis from scratch by prompting aligned llms with nothing.arXiv:2406.08464,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.372812Z"},"links":{"cited_paper":"/paper/2406.08464","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:7fa7c410dc1fc5116d94aae28e7f645b61a05078243c6c0dd1b2ec001f9de873","observation_id":"5eec8c89-7ded-4ce5-a570-d84249f49c0f","resolution":{"observed_at":"2026-08-02T15:39:40.372812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.11838","last_updated":"2026-07-23T15:24:41Z","snapshot_observed_at":"2026-08-07T10:07:46.710244Z","submitted_at":"2026-03-12T12:04:43Z","title":"DatedGPT: Preventing Lookahead Bias in Large Language Models with Time-Aware Pretraining","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.11838","snapshot_observed_at":"2026-08-02T15:39:40.479528Z","title":"Datedgpt: Preventing looka- head bias in large language models with time-aware pretraining.arXiv:2603.11838,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.479528Z"},"links":{"cited_paper":"/paper/2603.11838","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:3f5c813b26e32ca1989ac11b5713069fe4b9155756dd3d749b2dfe379206bbf5","observation_id":"9e99ce94-e893-4a5a-9221-65c1ac332435","resolution":{"observed_at":"2026-08-02T15:39:40.479528Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.02736","last_updated":"2024-10-04T03:57:47Z","snapshot_observed_at":"2026-08-01T08:21:19.528254Z","submitted_at":"2024-10-03T17:53:30Z","title":"Justice or Prejudice? Quantifying Biases in LLM-as-a-Judge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.02736","snapshot_observed_at":"2026-08-02T15:39:40.589218Z","title":"Justice or prejudice? quantifying biases in llm-as-a- judge.arXiv:2410.02736,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.589218Z"},"links":{"cited_paper":"/paper/2410.02736","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:ffedefa39ab7ed52568042206545c452bb2c38e2b438315f142d630d9bd9e615","observation_id":"cbae58dc-14c7-430b-ba38-daaf56ad0918","resolution":{"observed_at":"2026-08-02T15:39:40.589218Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1905.07830","last_updated":"2019-05-19T23:57:23Z","snapshot_observed_at":"2026-07-31T00:09:56.948833Z","submitted_at":"2019-05-19T23:57:23Z","title":"HellaSwag: Can a Machine Really Finish Your Sentence?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1905.07830","snapshot_observed_at":"2026-08-02T15:39:40.765601Z","title":"Hellaswag: Can a machine really finish your sentence?arXiv:1905.07830,","venue":null,"work_id":null,"year":1905},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.765601Z"},"links":{"cited_paper":"/paper/1905.07830","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:529718ce95f82a72a35616bfad8248f7142c20d1d1fa11688b6ef5cac46fa5a5","observation_id":"84d408ba-4509-4f6d-b005-2f79998aa2be","resolution":{"observed_at":"2026-08-02T15:39:40.765601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.00732","last_updated":"2024-04-29T04:01:45Z","snapshot_observed_at":"2026-07-06T18:08:21.770341Z","submitted_at":"2024-04-29T04:01:45Z","title":"LoRA Land: 310 Fine-tuned LLMs that Rival GPT-4, A Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.00732","snapshot_observed_at":"2026-08-02T15:39:40.884582Z","title":"Lora land: 310 fine-tuned llms that rival gpt-4, a technical report.arXiv:2405.00732,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:40.884582Z"},"links":{"cited_paper":"/paper/2405.00732","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:9f21d600f8dca828d13bad54f5e16ca2669fcea406e2c4ac88e268dc77d04f09","observation_id":"19bee359-5d2a-4e08-85d9-69e08810bd15","resolution":{"observed_at":"2026-08-02T15:39:40.884582Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.07137","last_updated":"2025-03-02T14:28:33Z","snapshot_observed_at":"2026-08-05T04:25:06.335932Z","submitted_at":"2024-10-09T17:53:06Z","title":"Cheating Automatic LLM Benchmarks: Null Models Achieve High Win Rates","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.07137","snapshot_observed_at":"2026-08-02T15:39:41.034599Z","title":"Cheating automatic llm benchmarks: Null models achieve high win rates.arXiv:2410.07137,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:41.034599Z"},"links":{"cited_paper":"/paper/2410.07137","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:bf2648ec34688bac8c5cbb70d983e140a7619351a6710237bc5d9abef5298d6f","observation_id":"fd3875b1-f33e-4c95-9cb1-418577fba973","resolution":{"observed_at":"2026-08-02T15:39:41.034599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-02T15:39:41.133938Z","title":"Instruction-following evaluation for large language models.arXiv:2311.07911,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:41.133938Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:540e68bdbeea2798e91ff3f882d860b610212e01b930b471bd3dd313acff2a3b","observation_id":"32a4545c-bc50-4129-943f-083306887139","resolution":{"observed_at":"2026-08-02T15:39:41.133938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.17897","last_updated":"2025-06-08T16:04:59Z","snapshot_observed_at":"2026-07-06T19:38:31.218025Z","submitted_at":"2024-10-23T14:15:07Z","title":"Value Residual Learning","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.17897","snapshot_observed_at":"2026-08-02T15:39:41.279102Z","title":"Value residual learning for alleviating attention concentration in transformers","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:41.279102Z"},"links":{"cited_paper":"/paper/2410.17897","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:fec898209ae895ee6acbb75f93ac2bb061f9eaba25504574f8e254bf1a0b5d9f","observation_id":"ce59e45b-da86-4834-964c-c04b5a410923","resolution":{"observed_at":"2026-08-02T15:39:41.279102Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:39:41.455438Z","title":"timeless","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:41.455438Z"},"links":{"citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:05df68c6329e4e6566a3a170db394e13c93d5333f71e853a3036cfdbf20588b5","observation_id":"a020f25c-afe2-4026-a937-d1f8316d3bc8","resolution":{"observed_at":"2026-08-02T15:39:41.455438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T15:39:35.931678Z","title":"Language models are few-shot learners.Advances in neural information processing systems, 33:1877–1901,","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":1999,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:35.931678Z"},"links":{"citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:cbe56e61f3a4292003215e1fbdc269592e8fba9585baff9057176afde1552d5b","observation_id":"cd1fbd95-250e-4462-8414-a82160610f38","resolution":{"observed_at":"2026-08-02T15:39:35.931678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.15556","last_updated":"2022-03-29T13:38:03Z","snapshot_observed_at":"2026-07-06T12:54:11.616335Z","submitted_at":"2022-03-29T13:38:03Z","title":"Training Compute-Optimal Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.15556","snapshot_observed_at":"2026-08-02T15:39:37.632868Z","title":"Training compute-optimal large language models.arXiv:2203.15556,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2008,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.632868Z"},"links":{"cited_paper":"/paper/2203.15556","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:3150165e611e9b630565680e32dd9f01d4e4acd6f2c5f52882f0a595e10242cb","observation_id":"e0b36825-18f0-4136-b9bb-cf79b5e5a7be","resolution":{"observed_at":"2026-08-02T15:39:37.632868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.18392","last_updated":"2024-10-17T12:01:15Z","snapshot_observed_at":"2026-07-06T18:21:26.195207Z","submitted_at":"2024-05-28T17:33:54Z","title":"Scaling Laws and Compute-Optimal Training Beyond Fixed Training Durations","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.18392","snapshot_observed_at":"2026-08-02T15:39:37.355927Z","title":"Scaling laws and compute-optimal training beyond fixed training durations","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2018,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:37.355927Z"},"links":{"cited_paper":"/paper/2405.18392","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:4a18641fd94d977f68341803ab7d51adb52f426fd9d76c8c8b0b693f673eab98","observation_id":"db6076a0-f5b2-49bf-89e4-fff2dbae6c71","resolution":{"observed_at":"2026-08-02T15:39:37.355927Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-02T15:39:36.327329Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2019,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.327329Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:6f242102ef962aa51804e3cc6469e7cb9fc4a83178fa7ab4ce1431a961b08965","observation_id":"50410378-b1fc-4b6c-b814-488b57fc1a8a","resolution":{"observed_at":"2026-08-02T15:39:36.327329Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.08207","last_updated":"2022-03-17T17:53:01Z","snapshot_observed_at":"2026-07-06T11:58:21.596920Z","submitted_at":"2021-10-15T17:08:57Z","title":"Multitask Prompted Training Enables Zero-Shot Task Generalization","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.08207","snapshot_observed_at":"2026-08-02T15:39:39.110714Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2021,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:39.110714Z"},"links":{"cited_paper":"/paper/2110.08207","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:3adf850b4bf86d6c2e92f0b927f7dccf1f5001df6c8fc51d2a157c1ae375d180","observation_id":"4bd0a868-1c11-4661-83df-534d919fd76c","resolution":{"observed_at":"2026-08-02T15:39:39.110714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.07263","last_updated":"2024-07-09T22:37:59Z","snapshot_observed_at":"2026-08-07T09:28:48.845112Z","submitted_at":"2024-07-09T22:37:59Z","title":"Reuse, Don't Retrain: A Recipe for Continued Pretraining of Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.07263","snapshot_observed_at":"2026-08-02T15:39:38.991398Z","title":"Reuse, don’t retrain: A recipe for continued pretraining of language models.arXiv:2407.07263,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:38.991398Z"},"links":{"cited_paper":"/paper/2407.07263","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:73ee82aedb32e8ba29e1623288a74fa179c73f0eadc2748311cf056da0dffd7c","observation_id":"8a46a709-477f-4666-aea3-e7bf095daf4b","resolution":{"observed_at":"2026-08-02T15:39:38.991398Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-07-06T14:08:18.855958Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-02T15:39:36.170673Z","title":"Chi, Jeff Dean, Jacob Devlin, Adam Roberts, Denny Zhou, Quoc V","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.170673Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:7528f42def651fae6923aa0af7a81ab94ffcd266289db24ebf568c0d69621577","observation_id":"7cc9cfde-0496-4cc1-9811-d1c0a82b1012","resolution":{"observed_at":"2026-08-02T15:39:36.170673Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-02T15:39:35.388301Z","title":"Qwen technical report, 2023a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:35.388301Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:3d788b52ad11ffbaf78ce31b9f56c96ee8ac05ebca37a8fa84213145d1de912f","observation_id":"70fab7eb-bbf5-4f05-a9ed-43bb7b754f71","resolution":{"observed_at":"2026-08-02T15:39:35.388301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.01937","last_updated":"2023-05-03T07:28:50Z","snapshot_observed_at":"2026-08-02T17:07:32.299595Z","submitted_at":"2023-05-03T07:28:50Z","title":"Can Large Language Models Be an Alternative to Human Evaluations?","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.01937","snapshot_observed_at":"2026-08-02T15:39:36.027708Z","title":"Can large language models be an alternative to human evaluations?arXiv:2305.01937,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2025,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.027708Z"},"links":{"cited_paper":"/paper/2305.01937","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:aaadff6ba65c74b0210f9f47dcbed241f849c48f4cbb0c940eb2485eea7507c8","observation_id":"421e9056-0d74-47db-801a-056fae582872","resolution":{"observed_at":"2026-08-02T15:39:36.027708Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-02T15:39:36.451517Z","title":"Yann Dubois, Bal´ azs Galambosi, Percy Liang, and Tatsunori B Hashimoto","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models","version":2},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-02T15:39:36.451517Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2607.11889"},"observation_digest":"sha256:9d799c4d16e03309b0354b310b876ab3f3d8e65133c8fbf942fd8a964d85d9b4","observation_id":"83fc76ca-087f-4985-b418-b84ca836e962","resolution":{"observed_at":"2026-08-02T15:39:36.451517Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.11889","last_updated":"2026-07-17T09:32:58Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T12:28:12.211551Z","submitted_at":"2026-04-24T17:00:53Z","title":"Scaling Point-in-Time Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2607.11889."}