{"as_of":"2026-08-09T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5c6dd85fa4b9c81ddede1808b29e0b2bdc96a28676eb191bf5e605a8e78d2fd6","coverage":[{"denominator":51,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":51,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:33:43.787531Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2509.06524/citation-record","integrity":"/paper/2509.06524/integrity","json":"/paper/2509.06524/citation-record.json","paper":"/paper/2509.06524"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:38.928351Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:38.928351Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ab2861d3cd2c9c64f3f68e207fe96ab66af28be380d8f3d694bed313303f0253","observation_id":"36611695-46bc-4fbd-84b8-32bb852895e0","resolution":{"observed_at":"2026-08-04T23:33:38.928351Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-04T23:33:39.032615Z","title":"Cai, Michael Terry, Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.032615Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3395a31e09ebcf96241352ad34e213009f8d0faac516d8f7e9a1d4bd3dd019b8","observation_id":"b8a1c987-f9d3-4830-97bd-5cac28f49bee","resolution":{"observed_at":"2026-08-04T23:33:39.032615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.846993Z","title":"Color-filter: Conditional loss reduction filtering for targeted language model pre-training","venue":null,"work_id":"6dcac167-9fa1-408d-bafd-49925a531f15","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.142597Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:4beb537701c178e4c278d9fb4fcb8aee96af663d21f057810a07e2f3f3e47683","observation_id":"1f02c21e-0bd0-43f5-8ed4-61aa24933c99","resolution":{"observed_at":"2026-08-04T23:33:47.896802Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:39.203281Z","title":"Statistical inference","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.203281Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0fc6057899c0787f6999d329cb90f139be5638d44d6c9852661d769063718c8c","observation_id":"7f3a2181-16a7-4984-a9b9-c71cb163f229","resolution":{"observed_at":"2026-08-04T23:33:39.203281Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.09246","last_updated":"2023-05-16T07:52:57Z","snapshot_observed_at":"2026-08-05T06:19:25.316529Z","submitted_at":"2023-05-16T07:52:57Z","title":"Maybe Only 0.5% Data is Needed: A Preliminary Exploration of Low Training Data Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.09246","snapshot_observed_at":"2026-08-04T23:33:39.307095Z","title":"Maybe only 0.5\\ arXiv preprint arXiv:2305.09246, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.307095Z"},"links":{"cited_paper":"/paper/2305.09246","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:09ef0c42b275ccec99325a93abc1e1a302df82ae49eca94f6ece8f92fe95dc17","observation_id":"31f8ba62-0d74-4f2a-93fa-901086584fb9","resolution":{"observed_at":"2026-08-04T23:33:39.307095Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:39.420873Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.420873Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9500d2e61f6597b186aa1224158a6a249b07f85edb6e1b590e3fb89257e843da","observation_id":"d394646a-6661-4c17-8887-8e4894c4c885","resolution":{"observed_at":"2026-08-04T23:33:39.420873Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-07T01:45:38.840969Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-04T23:33:39.555558Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.555558Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:6217dbd650b66f17a110406487b2631abb92624e00badd4a435c04f146c831ac","observation_id":"704d50ee-96cd-4719-aea2-56c47465eb94","resolution":{"observed_at":"2026-08-04T23:33:39.555558Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-04T23:33:39.625275Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.625275Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:947d75c1595b858ad78fffea68669c093e263214bb117dd3426c179cc3a1bfd6","observation_id":"287cdd5e-d610-4783-8cf1-ef9e6da14912","resolution":{"observed_at":"2026-08-04T23:33:39.625275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.720155Z","title":"Sketchy moment matching: Toward fast and provable data selection for finetuning","venue":null,"work_id":"622e7d56-381e-4309-b713-0d15658695e0","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.744619Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8499c9369440a27b2f8297867ab2cf2cc6eca26c360dbc51538950117136d42d","observation_id":"2ce12f0a-0236-4e3e-919b-87c55dcfe2ae","resolution":{"observed_at":"2026-08-04T23:33:47.785803Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.621841Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"794425ae-07c1-4e51-8742-178cd41206ab","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.805459Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:624705c137818a8a2118b31570bf79f760c852a28bccab8658c7f26bdf8f5230","observation_id":"14b74413-3450-492a-a832-84dcac04a4c6","resolution":{"observed_at":"2026-08-04T23:33:47.679914Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.515885Z","title":"Dsdm: Model-aware dataset selection with datamodels","venue":null,"work_id":"0ccb3497-1b42-4148-980b-6ca89947a468","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:39.929141Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:183d638aaf961d17d2c7d2d5e42d9ef8c5aaa1b6e700c24338689c241f3658e1","observation_id":"b41baaee-b249-45ce-80bb-435e46fd4c17","resolution":{"observed_at":"2026-08-04T23:33:47.552421Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.333443Z","title":"Evans, Gordon B","venue":null,"work_id":"d42c8c71-a59c-4a44-979e-b0ef262a4a41","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.029161Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:aaaa0fe91b446b959efc4bec5fb9ba1c344b9d297f000678ac24079fef6affe1","observation_id":"9e408eab-4345-4f8c-ba54-82c54f1b0b66","resolution":{"observed_at":"2026-08-04T23:33:47.419687Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.230460Z","title":"GIO : Gradient information optimization for training dataset selection","venue":null,"work_id":"a8e8fdc3-ba2b-4960-93f5-25b7ae3ba48c","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.125862Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:fddf63ce58288b9ff31dee298803366d10097df7be16cf20d2b11d7155c85457","observation_id":"7768ed40-0b9f-49ac-a8a0-5c6e23406c02","resolution":{"observed_at":"2026-08-04T23:33:47.268358Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03065","last_updated":"2024-01-05T20:53:51Z","snapshot_observed_at":"2026-07-06T17:12:10.787061Z","submitted_at":"2024-01-05T20:53:51Z","title":"CRUXEval: A Benchmark for Code Reasoning, Understanding and Execution","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03065","snapshot_observed_at":"2026-08-04T23:33:40.212176Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.212176Z"},"links":{"cited_paper":"/paper/2401.03065","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:d671df40974d590ae850b37f01a66ed25569810a66aa42faf60aa01e7069d623","observation_id":"76aea87e-84af-4f9d-90f8-6dbdca0f4488","resolution":{"observed_at":"2026-08-04T23:33:40.212176Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:47.050129Z","title":"Data selection via optimal control for language models","venue":null,"work_id":"e7c2ceee-ae81-4e59-935b-a0ef0debc1ba","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.321974Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:7b6100bbb663fa35485224e077e82d891c63588c3d84ca4b3bfbdc73109c9173","observation_id":"cafc6fa2-8a3c-48f4-a098-066c6a9741c4","resolution":{"observed_at":"2026-08-04T23:33:47.145456Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.941503Z","title":"SHED : Shapley-based automated dataset refinement for instruction fine-tuning","venue":null,"work_id":"b18216cb-d645-4cde-8b57-580d101363a1","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.435948Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:60631a21f46432050106bb8e4eb4c952aef2772160d24190589fbe9183eb5c65","observation_id":"46d76be7-5a67-48c0-98a5-fc5bab34c857","resolution":{"observed_at":"2026-08-04T23:33:47.000442Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2501.06708","last_updated":"2026-05-25T22:00:48Z","snapshot_observed_at":"2026-07-06T20:19:50.997046Z","submitted_at":"2025-01-12T04:28:14Z","title":"Evaluating Sample Utility for Efficient Data Selection by Mimicking Model Weights","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.06708","snapshot_observed_at":"2026-08-04T23:33:40.574514Z","title":"Evaluating sample utility for data selection by mimicking model weights","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.574514Z"},"links":{"cited_paper":"/paper/2501.06708","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:12933cefaa78ed889d87cc258bd5a106bafd701f1093bb19bfdcfc8efd176f49","observation_id":"f797b552-f111-48b8-87c1-5ee5e7140c79","resolution":{"observed_at":"2026-08-04T23:33:40.574514Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.843302Z","title":"Livecodebench: Holistic and contamination free evaluation of large language models for code","venue":null,"work_id":"87471e4f-30c1-4fe4-9484-a369b0390784","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.678681Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:d9ce729475b81b311c10ef94ae7347166107d2cf9d55ec83129bd9de5e40109c","observation_id":"f75f2856-375b-4f60-9c50-be598e2a3354","resolution":{"observed_at":"2026-08-04T23:33:46.868735Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-04T23:33:40.766727Z","title":"Brown, Benjamin Chess, Rewon Child, Scott Gray, Alec Radford, Jeff Wu, and Dario Amodei","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.766727Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8a27d52db85e20aa65e81da714c13f4dc4c3efc6b8f70b0e42160814d5cc6fd0","observation_id":"b51f0d1c-0cd2-4268-b5a4-3e4c2f94796f","resolution":{"observed_at":"2026-08-04T23:33:40.766727Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:40.848381Z","title":"Rule-based data selection for large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.848381Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:738eebecc11ddd5753f6a4cbfd88ddc8ec4ad070f768e2f5c4afb523f8731d73","observation_id":"64f03e7b-26a4-4318-a00c-338e4acd4453","resolution":{"observed_at":"2026-08-04T23:33:40.848381Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.723887Z","title":"One shot learning as instruction data prospector for large language models","venue":null,"work_id":"6c050e42-9df0-460e-a131-5f91f60fdebe","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:40.963618Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:a75db7de044a66ba8a59e7faf5f1dfebec50b5f8b224381af1d65daf829fc0e1","observation_id":"e6b10f93-d954-4d7b-b8c1-9a101d5fd801","resolution":{"observed_at":"2026-08-04T23:33:46.794695Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:41.043044Z","title":"D 2 LLM : Decomposed and distilled large language models for semantic search","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.043044Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:a0382904ba7b80ce42b099282169100ce7e303de62188fbb99eddcb4f3569404","observation_id":"c561e07e-59f4-4c65-a8cd-535feab56a53","resolution":{"observed_at":"2026-08-04T23:33:41.043044Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.20050","last_updated":"2023-05-31T17:24:00Z","snapshot_observed_at":"2026-08-05T13:11:04.104454Z","submitted_at":"2023-05-31T17:24:00Z","title":"Let's Verify Step by Step","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.20050","snapshot_observed_at":"2026-08-04T23:33:41.158139Z","title":"Let's verify step by step","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.158139Z"},"links":{"cited_paper":"/paper/2305.20050","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:e366eb8d004c6698815dbea01bbc72492a13a86c9c13fce7010da562f01ec6de","observation_id":"bbd39cec-346f-458f-8e51-2b755225f82e","resolution":{"observed_at":"2026-08-04T23:33:41.158139Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.570040Z","title":"What makes good data for alignment? a comprehensive study of automatic data selection in instruction tuning","venue":null,"work_id":"bd60fafb-efe9-4cb3-ba0d-f9ee14cc1741","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.278710Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:172db9a2b3c008c7881554e3f227a73a5b6970a9593eb16f1401d14516dd2f47","observation_id":"b9cfc409-4cc6-4d3b-be00-7e8eea0a4f66","resolution":{"observed_at":"2026-08-04T23:33:46.617318Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14115","last_updated":"2025-02-24T07:59:00Z","snapshot_observed_at":"2026-08-01T14:34:04.237282Z","submitted_at":"2024-06-20T08:58:58Z","title":"Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models","version":2},"cited_work":{"arxiv_id":"2406.14115","doi":null,"metadata_source":"pith","pith_arxiv_id":"2406.14115","snapshot_observed_at":"2026-08-04T23:33:44.202811Z","title":"Take the essence and discard the dross: A Rethinking on Data Selection for Fine-Tuning Large Language Models","venue":"cs.CL","work_id":"fa1d9155-a526-4114-8bf1-e5ce8529603d","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.391669Z"},"links":{"cited_paper":"/paper/2406.14115","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:c07587ce45e780bb8dca7bc05b2988c4ffe24fcfeb1a6d51f5736186abbc55ab","observation_id":"033ccbfb-96c2-4282-93a0-05f3e839a323","resolution":{"observed_at":"2026-08-04T23:33:44.238868Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.414289Z","title":"TSDS : Data selection for task-specific model finetuning","venue":null,"work_id":"4fcfbdb5-30a2-46fa-84f4-fc9c347943fd","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.467553Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0a8374eb9565fe2fd66c6bf2a83670a1a3bb1659ccd4834cad9343112e6b07d6","observation_id":"0fab0a4b-2e75-415d-83e8-751c43aebed6","resolution":{"observed_at":"2026-08-04T23:33:46.481496Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.288318Z","title":"When less is more: Investigating data pruning for pretraining llms at scale","venue":null,"work_id":"24a78b21-42bb-488d-9d76-88ce49855873","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.587282Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3bc4f201f76fdb08d6fa989ea9f113e558fd6cc276ed0de169155126021be29e","observation_id":"5af94284-6847-4d3b-a7ab-6e956edfb3e9","resolution":{"observed_at":"2026-08-04T23:33:46.335102Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2202.08904","last_updated":"2022-08-05T09:33:10Z","snapshot_observed_at":"2026-08-05T15:40:41.912643Z","submitted_at":"2022-02-17T21:35:56Z","title":"SGPT: GPT Sentence Embeddings for Semantic Search","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2202.08904","snapshot_observed_at":"2026-08-04T23:33:41.675399Z","title":"Sgpt: Gpt sentence embeddings for semantic search","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.675399Z"},"links":{"cited_paper":"/paper/2202.08904","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:6b807c751fa4f96dd9fcbacbf3b13082d5d64c279ff843303491f7a112db5aea","observation_id":"5e28398d-e475-4374-a303-2403924068b6","resolution":{"observed_at":"2026-08-04T23:33:41.675399Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:46.103523Z","title":"Scaling data-constrained language models","venue":null,"work_id":"781ce706-b45a-4a16-9795-b37dc3a2fd44","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.773607Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:573864a80a810cd4ebf846dfd6cd6778925f85fe00c67d7d0e48892fcc07270e","observation_id":"68f05c8d-a0b9-43a0-9d3e-a26c6679a32c","resolution":{"observed_at":"2026-08-04T23:33:46.156191Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.931316Z","title":"Trak: Attributing model behavior at scale","venue":null,"work_id":"b8492bf2-fc64-4553-92ce-e74ab0444c60","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:41.873846Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:d27a88775a3d504cda77494fc0e9d3e10cc6e1fe90eda2311561cd315f4be57b","observation_id":"9631d39c-eeeb-4309-90f6-e80fb02a35b2","resolution":{"observed_at":"2026-08-04T23:33:46.032466Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.18982","last_updated":"2024-10-08T15:13:01Z","snapshot_observed_at":"2026-07-06T19:39:15.025945Z","submitted_at":"2024-10-08T15:13:01Z","title":"O1 Replication Journey: A Strategic Progress Report -- Part 1","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.18982","snapshot_observed_at":"2026-08-04T23:33:42.000535Z","title":"O1 replication journey: A strategic progress report - part 1","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.000535Z"},"links":{"cited_paper":"/paper/2410.18982","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ea67e39e001587b4731a74c8af4969945234b08c57e36a0fb9c83a9a31d9a959","observation_id":"acc2dabf-d3ea-449f-9358-ffe2e6ef2a66","resolution":{"observed_at":"2026-08-04T23:33:42.000535Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:42.093912Z","title":"Learning to retrieve prompts for in-context learning","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.093912Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:0aab8115259911b4acc9b5c97d3751144c2afa680ae7ef953944eaca14475874","observation_id":"7f810919-8077-4187-bde1-1256f67ea180","resolution":{"observed_at":"2026-08-04T23:33:42.093912Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.09668","last_updated":"2024-02-15T02:27:57Z","snapshot_observed_at":"2026-08-07T11:18:58.227690Z","submitted_at":"2024-02-15T02:27:57Z","title":"How to Train Data-Efficient LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.09668","snapshot_observed_at":"2026-08-04T23:33:42.206386Z","title":"McAuley, and Derek Zhiyuan Cheng","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.206386Z"},"links":{"cited_paper":"/paper/2402.09668","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:358ac6a35d54a90af44761fab20353f561bf19971f3b971378663758dc1a25e6","observation_id":"3a86b5a3-61a3-4750-a132-2cb73815b823","resolution":{"observed_at":"2026-08-04T23:33:42.206386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2024.11174","doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.060102Z","title":"Improving dense retrieval models with llm augmented data for dataset search","venue":null,"work_id":"fb3ad18e-f189-4c1f-9f5d-90e7d05ddf5e","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.268814Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:fd43486a46e9f727dab6bf697480c3eeb8e578811c6bc56cfcc375982c377a45","observation_id":"2796cf24-d707-4247-87ea-8d61144007e7","resolution":{"observed_at":"2026-08-04T23:33:44.112021Z","resolver_source":"raw_fallback","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.821544Z","title":"Improving pretraining data using perplexity correlations","venue":null,"work_id":"b78793d8-1257-4ddd-8ff8-1c886b1fec67","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.396817Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:b0e5e07a708446b1f414561780eaa5a6bb69ab2b478284f4bf11278452960e46","observation_id":"46a246d7-5e3a-422f-9a78-9df8a2838166","resolution":{"observed_at":"2026-08-04T23:33:45.862471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2302.13971","last_updated":"2023-02-27T17:11:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-02-27T17:11:15Z","title":"LLaMA: Open and Efficient Foundation Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.13971","snapshot_observed_at":"2026-08-04T23:33:42.513074Z","title":"Llama: Open and efficient foundation language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.513074Z"},"links":{"cited_paper":"/paper/2302.13971","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:207d98cc68d895e9fbd096409d0292ba0c13df6eb2bf005dc51ccf3f41bf44c2","observation_id":"fa571434-966d-4901-b7b2-d3dd0024c090","resolution":{"observed_at":"2026-08-04T23:33:42.513074Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.18653/v1/2024.emnlp-main.777","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"How do your code LLM s perform? empowering code instruction tuning with really good data","venue":null,"work_id":"0ba06968-9a6d-4095-97c4-9db204bb524c","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.576550Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:180c2cc4e3c7e6df3f202d05d068f95377babfb97fd466f76be0e0933ac3b828","observation_id":"f0f48a32-4456-4e6a-b220-8ef69370507d","resolution":{"observed_at":"2026-08-04T23:33:45.737973Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.561269Z","title":"QuRating : Selecting high-quality data for training language models","venue":null,"work_id":"9485d7e1-3b27-4586-84da-6507548b4c60","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.689126Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:fa404bed751d433e44152f52be4ad9b20bc7e20ddf60e43184a225c110b3ac87","observation_id":"4c1b800b-8ca5-4467-8ea0-988b5cf2a74d","resolution":{"observed_at":"2026-08-04T23:33:45.605862Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.386660Z","title":"LESS : Selecting influential data for targeted instruction tuning","venue":null,"work_id":"906dc8fb-18cd-4f19-8eaa-9837ef139a5d","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.789506Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:448be7fa64dcf74b801dbe025335c53fadc5d747e4ca240a301348a0a04e9a39","observation_id":"cb22c5e6-6e93-49f8-998b-a50e84f659d8","resolution":{"observed_at":"2026-08-04T23:33:45.464921Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.205311Z","title":"Data selection for language models via importance resampling","venue":null,"work_id":"cde19ff6-31f9-47aa-8c13-c5f0b4ce7bcf","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.880975Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:57f77b06346606a8cd0690067aa7a6d6fb1c44f4a8b0f21c58d3aeaf41e2ba53","observation_id":"d58a49f6-035b-4227-b3bd-5532c68c0beb","resolution":{"observed_at":"2026-08-04T23:33:45.284526Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:45.031189Z","title":"Wizard LM : Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":"7cdf7847-2968-423a-b8ca-6bdfd03103b4","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:42.976695Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:a19e9692278668603cfc8eb8af6a211e87b9bca32eb89bc7a09df1f3ff30b604","observation_id":"f481929d-97f7-4e8b-9e38-5883038d6f20","resolution":{"observed_at":"2026-08-04T23:33:45.103528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.890952Z","title":"Diffusion models: A comprehensive survey of methods and applications","venue":null,"work_id":"b7244258-9d2e-4d51-9964-9e3335bcdfc6","year":2022},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.091247Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:ac2e2fef6bf4addb9f638c7ab9c8cdeb59823845e5e9356e1a5a8867f7249dda","observation_id":"46a96f41-d786-4306-8a1b-96158de5e3c9","resolution":{"observed_at":"2026-08-04T23:33:44.964591Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2502.03387","last_updated":"2025-07-29T16:23:02Z","snapshot_observed_at":"2026-08-08T04:13:22.884923Z","submitted_at":"2025-02-05T17:23:45Z","title":"LIMO: Less is More for Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.03387","snapshot_observed_at":"2026-08-04T23:33:43.168667Z","title":"Limo: Less is more for reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.168667Z"},"links":{"cited_paper":"/paper/2502.03387","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:7cf32284771a06e66f94cc7eab7beda964cae04765c6404c522db1993358ed6e","observation_id":"2a0ed0ab-e21f-40d8-a1c9-3fc0cb07deef","resolution":{"observed_at":"2026-08-04T23:33:43.168667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.785364Z","title":"Mates: Model-aware data selection for efficient pretraining with data influence models","venue":null,"work_id":"08a18ec8-af40-4750-bf32-b5a5890b501e","year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":44,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.283879Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:3691bb1e2c3740d3cbfd4931777cfb08616e71f9e2618c0a59159159b7003eb2","observation_id":"101acc96-721f-4334-ba95-5ca3454b2b14","resolution":{"observed_at":"2026-08-04T23:33:44.836188Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.01219","last_updated":"2025-09-14T09:34:46Z","snapshot_observed_at":"2026-07-06T16:13:46.112815Z","submitted_at":"2023-09-03T16:56:48Z","title":"Siren's Song in the AI Ocean: A Survey on Hallucination in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.01219","snapshot_observed_at":"2026-08-04T23:33:43.405092Z","title":"Siren's song in the ai ocean: a survey on hallucination in large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":45,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.405092Z"},"links":{"cited_paper":"/paper/2309.01219","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8734dab43d84b512ee4051951ab6acc43fd302272cbcb95eaf4fcd8f8aeab640","observation_id":"c9202663-b1d7-44aa-a5fc-987e70b7257a","resolution":{"observed_at":"2026-08-04T23:33:43.405092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.593556Z","title":"Beyond similarity: A gradient-based graph method for instruction tuning data selection","venue":null,"work_id":"254d6bfb-5aab-412c-97b4-46a555013993","year":2025},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":46,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.483174Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:be843d840832503fe07f393e6a5bbe3f4cce119b108bcab3ab594c3c859246eb","observation_id":"c5e85840-c6e5-4cad-959e-3d8b7ab4e27a","resolution":{"observed_at":"2026-08-04T23:33:44.679324Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14658","last_updated":"2025-01-07T05:37:04Z","snapshot_observed_at":"2026-08-06T03:14:31.781649Z","submitted_at":"2024-02-22T16:06:23Z","title":"OpenCodeInterpreter: Integrating Code Generation with Execution and Refinement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14658","snapshot_observed_at":"2026-08-04T23:33:43.578607Z","title":"Opencodeinterpreter: Integrating code generation with execution and refinement","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":47,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.578607Z"},"links":{"cited_paper":"/paper/2402.14658","citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:8458c3e88ac679e4d6bf3d437e7ff1c4bfb36e8af264653a8401c4990c565e5d","observation_id":"d5965d9f-92de-4616-bf9d-b506567a1a1e","resolution":{"observed_at":"2026-08-04T23:33:43.578607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:44.475414Z","title":"LIMA : Less is more for alignment","venue":null,"work_id":"6c698d54-eaa2-4031-b511-0124ad119828","year":2023},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":48,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.635829Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9fc1f994f78eb7b8e2e20f2252b89fd6c92c703a3f257800ebf648e2fabd2405","observation_id":"f21446f6-c20a-4297-929b-296eea4bcc5a","resolution":{"observed_at":"2026-08-04T23:33:44.510160Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.685397Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":49,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.685397Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:9c580b02630d480a63019771dea54efcd3c2854e5571753747af7d35e127d334","observation_id":"aa2630f7-9d58-403b-a007-d0b16e3eb506","resolution":{"observed_at":"2026-08-04T23:33:43.685397Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.748037Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":50,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.748037Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:04486d952418a2b4f85217db868541a93ea6c9b58308237bd0f2a2e292f3c2f0","observation_id":"973bf3af-5dd0-49ab-99f3-8b02a3d4ca37","resolution":{"observed_at":"2026-08-04T23:33:43.748037Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-04T23:33:43.787531Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection","version":1},"reference_index":51,"source":"arxiv_source","source_observed_at":"2026-08-04T23:33:43.787531Z"},"links":{"citing_paper":"/paper/2509.06524"},"observation_digest":"sha256:830236939da108465f8cfb48c2bbf86304f9f1d473fc633a1b6a19856d9a6dad","observation_id":"8358d436-b2da-4c60-8d74-37ec1cbb45bc","resolution":{"observed_at":"2026-08-04T23:33:43.787531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2509.06524","last_updated":"2025-09-08T10:30:58Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T01:24:37.601184Z","submitted_at":"2025-09-08T10:30:58Z","title":"LAMDAS: LLM as an Implicit Classifier for Domain-specific Data Selection"},"reference_resolution":{"displayed":51,"state_counts":{"malformed_identifier":0,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":24,"verified_exact":2,"verified_fuzzy":24},"total_outbound_references":51},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 51 of 51 outbound references and 0 inbound Pith citation observations for arXiv:2509.06524."}