{"as_of":"2026-08-07T19:49:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a104f61f2a31c1309f28c73a60a9920cd0d2394b1e1d52fca43cc0e34d74dd88","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-06T20:36:27.623294Z","state":"measured"},{"denominator":44,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":44,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-27T10:52:00.147391Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-03T08:17:45.480579Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"cited_work":{"arxiv_id":"2507.02378","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2507.02378","snapshot_observed_at":"2026-07-03T08:17:45.480579Z","title":"Jinlong Pang, Na Di, Zhaowei Zhu, Jiaheng Wei, Hao Cheng, Chen Qian, and Yang Liu","venue":null,"work_id":"e6d0997b-daa3-45e1-be2a-8e0582c02ca5","year":null},"citing_paper":{"arxiv_id":"2606.18286","last_updated":"2026-06-10T04:46:04Z","snapshot_observed_at":"2026-08-07T16:29:18.257991Z","submitted_at":"2026-06-10T04:46:04Z","title":"CODEBLOCK: Learning to Supervise Code at the Right Granularity","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-27T10:52:00.147391Z"},"links":{"cited_paper":"/paper/2507.02378","citing_paper":"/paper/2606.18286"},"observation_digest":"sha256:02241d6ee07aa141fc3505ec864e50ef3cda7a7f95ea8db6fffc49edd54434ff","observation_id":"dfdfb155-8e6d-4a70-b969-dda33eb07b5b","resolution":{"observed_at":"2026-07-03T08:17:45.481981Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2507.02378/citation-record","integrity":"/paper/2507.02378/integrity","json":"/paper/2507.02378/citation-record.json","paper":"/paper/2507.02378"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.253041Z","title":"online\" 'onlinestring :=","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.253041Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:a14d6580ce8b2ec91a4ea6132896cdcc431096385f2e56b7bde7b2be7bdd4841","observation_id":"6d47b29a-9b9a-41f5-910e-279a2f068392","resolution":{"observed_at":"2026-08-06T20:36:24.253041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.315891Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.315891Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f6fdd27d60f32c65184d4623b29c498b8a6a20da1668825205b85ff818f2be73","observation_id":"1530e288-60d8-4255-b14a-d55cd74c5e23","resolution":{"observed_at":"2026-08-06T20:36:24.315891Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-06T20:36:24.385469Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.385469Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4146b42b33c625c1f79f682bc140e68a88c0bec2ad97358bca61cd1cbb0fbaf6","observation_id":"184366e2-500e-4eb1-829d-34db6326aaff","resolution":{"observed_at":"2026-08-06T20:36:24.385469Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.20541","last_updated":"2024-05-30T23:50:20Z","snapshot_observed_at":"2026-07-06T18:23:05.893052Z","submitted_at":"2024-05-30T23:50:20Z","title":"Perplexed by Perplexity: Perplexity-Based Data Pruning With Small Reference Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.20541","snapshot_observed_at":"2026-08-06T20:36:24.475089Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.475089Z"},"links":{"cited_paper":"/paper/2405.20541","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:3f18f835cc0141dea64b9b5031fb3820747419bf9bb946287b29bbec213c0287","observation_id":"97b83b19-cb3b-48da-8586-428245df9003","resolution":{"observed_at":"2026-08-06T20:36:24.475089Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2108.07732","last_updated":"2021-08-16T03:57:30Z","snapshot_observed_at":"2026-08-02T19:23:53.535075Z","submitted_at":"2021-08-16T03:57:30Z","title":"Program Synthesis with Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2108.07732","snapshot_observed_at":"2026-08-06T20:36:24.565907Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.565907Z"},"links":{"cited_paper":"/paper/2108.07732","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:43fa74255843e59d8d2d533bdb6d4000d648beb4dc960aba5edfd833e39ff690","observation_id":"06a0b538-49bc-42fa-b0e2-0f6f3e6d3e03","resolution":{"observed_at":"2026-08-06T20:36:24.565907Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.639554Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.639554Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:17ced08f108e7f8926efcb75690ba5931610fad68fa9f92dece49e5b4c2cba83","observation_id":"17f165ad-e20b-461a-b16c-eb7e2d169c71","resolution":{"observed_at":"2026-08-06T20:36:24.639554Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.757317Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.757317Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:7bab22eb7b14823d0326fa0c40ef75f63481ec8e8e9a03a99d534a9fc309e329","observation_id":"5206f39d-1226-4e27-91e2-88f56bd5d02b","resolution":{"observed_at":"2026-08-06T20:36:24.757317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2107.03374","last_updated":"2021-07-14T17:16:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-07-07T17:41:24Z","title":"Evaluating Large Language Models Trained on Code","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2107.03374","snapshot_observed_at":"2026-08-06T20:36:24.858894Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.858894Z"},"links":{"cited_paper":"/paper/2107.03374","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:fc28a3278645e0d27b1c2ef0c7eb9ebde786db996b3b3717e3b2968af2ab7e48","observation_id":"d5a037d0-b2aa-4f90-8884-0236feaab071","resolution":{"observed_at":"2026-08-06T20:36:24.858894Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:24.909502Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:24.909502Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:9d2ff7e854acd72fe454e78afb4eb73df3b519fe239a0f3f0636c288f313e1dc","observation_id":"58cf13e3-02ce-4d70-bdec-2d458a6950fc","resolution":{"observed_at":"2026-08-06T20:36:24.909502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.11644","last_updated":"2023-10-02T06:12:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-20T16:14:25Z","title":"Textbooks Are All You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.11644","snapshot_observed_at":"2026-08-06T20:36:25.001113Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.001113Z"},"links":{"cited_paper":"/paper/2306.11644","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:8afde6fcf842d3d78f924ff14f6a5a2c9bf034b3fb7f999961ccee187c0abab4","observation_id":"410c93b6-55da-45c7-a6da-b73a48f59ae6","resolution":{"observed_at":"2026-08-06T20:36:25.001113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-06T20:36:25.065178Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.065178Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:6f65ad88004ea6523d0fc7d839aaff5fb37cca51cca4ee8aa8c338c85084c00e","observation_id":"2775ced7-4522-49e0-9601-6156dd447c01","resolution":{"observed_at":"2026-08-06T20:36:25.065178Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2401.14196","last_updated":"2024-01-26T09:23:11Z","snapshot_observed_at":"2026-08-06T22:40:28.707813Z","submitted_at":"2024-01-25T14:17:53Z","title":"DeepSeek-Coder: When the Large Language Model Meets Programming -- The Rise of Code Intelligence","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.14196","snapshot_observed_at":"2026-08-06T20:36:25.139734Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.139734Z"},"links":{"cited_paper":"/paper/2401.14196","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:dbda07a28703fc753690477fb0ebfabd20cf839c164be189b3afcc262c615192","observation_id":"61bb56d8-59dc-4dcd-b2b5-16f194ce122f","resolution":{"observed_at":"2026-08-06T20:36:25.139734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12186","last_updated":"2024-11-12T13:24:25Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-18T17:57:57Z","title":"Qwen2.5-Coder Technical Report","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12186","snapshot_observed_at":"2026-08-06T20:36:25.257707Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.257707Z"},"links":{"cited_paper":"/paper/2409.12186","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:9831a24b58825ef89f24780c148dd77c392fb56ad2a1d19971fb8bab446bbab5","observation_id":"074653b1-5ee5-434c-8111-5f36ba27708f","resolution":{"observed_at":"2026-08-06T20:36:25.257707Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-06T20:36:25.361808Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.361808Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:3b5b7970c380ae32f910eae3f0cda7a1d5a95c81989dadaa16971073cdbf64e7","observation_id":"f9330d3e-ff09-4296-bdaa-40f1d793c0a2","resolution":{"observed_at":"2026-08-06T20:36:25.361808Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:25.452332Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.452332Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:801659c8184434b97b68b624c88784410a50e261d6df114583d7dc03bd85d52e","observation_id":"eba46643-adc0-44cd-b9c7-03c3c742eb8a","resolution":{"observed_at":"2026-08-06T20:36:25.452332Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:30.498414Z","title":null,"venue":null,"work_id":"0dfdbe84-6b16-4b1f-8e2f-190221c7b4a1","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.568234Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:4ce917e1d5e41e08b05a3ea9118cdac1f7d0212ad1637db6c093243c23ce47c5","observation_id":"b33492bc-7508-48ed-b99d-733f56407e78","resolution":{"observed_at":"2026-08-06T20:36:30.640440Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:30.180865Z","title":null,"venue":null,"work_id":"719b1fb2-70fd-463a-9910-251e37306eb5","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.672751Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:420d1bace0d8d10da653c98192a3e9c4bea94c067e9503e0740761dee807a8df","observation_id":"b7e9c6df-9206-4ed7-a26f-06d81a4e8be0","resolution":{"observed_at":"2026-08-06T20:36:30.337089Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:25.756846Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.756846Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:1001649dc6e6bc2edbec85886512cfc033fde8c7355aa43aadee1d3d1e980866","observation_id":"e633a204-1831-4da0-baf4-d9da1cf7c6fa","resolution":{"observed_at":"2026-08-06T20:36:25.756846Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.06161","last_updated":"2023-12-13T14:44:10Z","snapshot_observed_at":"2026-07-06T15:25:35.930688Z","submitted_at":"2023-05-09T08:16:42Z","title":"StarCoder: may the source be with you!","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.06161","snapshot_observed_at":"2026-08-06T20:36:25.865573Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.865573Z"},"links":{"cited_paper":"/paper/2305.06161","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:bf74b22ac708a76ec826806058bb0a7cc0ac1ea88e4f50fec1a7cd38346ada59","observation_id":"4901747e-c2e9-4f05-8354-9e59b3ed2c33","resolution":{"observed_at":"2026-08-06T20:36:25.865573Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.19437","last_updated":"2025-02-18T17:26:38Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-27T04:03:16Z","title":"DeepSeek-V3 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.19437","snapshot_observed_at":"2026-08-06T20:36:25.952352Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:25.952352Z"},"links":{"cited_paper":"/paper/2412.19437","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:19e429c162da566a395fea6c7f89ce475e3e94d81382a14b1477f3a25efebad0","observation_id":"c0062fbd-1fd2-4397-a04a-aa7677df6893","resolution":{"observed_at":"2026-08-06T20:36:25.952352Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.051015Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.051015Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:5b8f06023c928e67191aa5d8129e82f158a4f26f8b9d5bb01a5db262ea6914ad","observation_id":"121d2710-c310-4b59-8e6d-41b8da29dc1a","resolution":{"observed_at":"2026-08-06T20:36:26.051015Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.149468Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.149468Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:bf944b73c259c1a46f929c730d89981bb05e305c492c1e18fe37acfdf1a76ab5","observation_id":"e18534e1-1e3b-49fa-b357-153a87a2e91c","resolution":{"observed_at":"2026-08-06T20:36:26.149468Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.19173","last_updated":"2024-02-29T13:53:35Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-02-29T13:53:35Z","title":"StarCoder 2 and The Stack v2: The Next Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.19173","snapshot_observed_at":"2026-08-06T20:36:26.249299Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.249299Z"},"links":{"cited_paper":"/paper/2402.19173","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:b5762df295c813a2d49db78e92ac71c6490745e4ffa02392aaba5c4632720bb1","observation_id":"7254fcc8-4a3e-4ff2-9549-c47b5b650947","resolution":{"observed_at":"2026-08-06T20:36:26.249299Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.812975Z","title":null,"venue":null,"work_id":"555339b6-d53d-48a8-a328-df1f4d39e8a1","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.344064Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:36e066a3fc85ff922bc8361cd9cc0e0ac3176a0776f404221f1d283cb439a055","observation_id":"dcb386fa-77db-4912-8493-1d401c48dd12","resolution":{"observed_at":"2026-08-06T20:36:29.952328Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.499055Z","title":null,"venue":null,"work_id":"0e1b6f48-206e-4793-817f-03d466f3d264","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.411577Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:31db06b9c8addd5dabd50b7516359d9fc28cdb55539988c59df3636578d96891","observation_id":"0814fd87-6cf6-40ce-bd1d-ad7a42a5d17e","resolution":{"observed_at":"2026-08-06T20:36:29.647463Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.12687","last_updated":"2025-04-17T06:29:28Z","snapshot_observed_at":"2026-08-07T16:01:35.237595Z","submitted_at":"2025-04-17T06:29:28Z","title":"Data-efficient LLM Fine-tuning for Code Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.12687","snapshot_observed_at":"2026-08-06T20:36:26.513190Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.513190Z"},"links":{"cited_paper":"/paper/2504.12687","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f21e71198afc3779b4d07b51cf2f8cebcf9c3d32d8cf73b982ba11ba8e78d34a","observation_id":"edcf25bf-0b2b-4cbd-88ff-bf72955a8efc","resolution":{"observed_at":"2026-08-06T20:36:26.513190Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-06T20:36:26.625005Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.625005Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:893f848563edbb841112c57aeafd2d7fa917e4074bb9710fa6d7b867ba8cdb3c","observation_id":"23ec378a-0a40-4984-8459-d63990473352","resolution":{"observed_at":"2026-08-06T20:36:26.625005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12950","last_updated":"2024-01-31T19:47:26Z","snapshot_observed_at":"2026-07-06T16:10:07.931347Z","submitted_at":"2023-08-24T17:39:13Z","title":"Code Llama: Open Foundation Models for Code","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12950","snapshot_observed_at":"2026-08-06T20:36:26.692660Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.692660Z"},"links":{"cited_paper":"/paper/2308.12950","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f8c2b1b95f59932fa6a7c08aa80a02bcb337e5163fe6ddb3348bb4eb2ca19ebd","observation_id":"4e2f2ddd-5b2f-40c3-bba2-2372b1e9c139","resolution":{"observed_at":"2026-08-06T20:36:26.692660Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:26.766654Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.766654Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:a1f3b999e3ffc9ca0d728aadcdd1acdce7418b14051e31d61c39a7691ae61aa5","observation_id":"60544639-b05d-4afe-8249-e27f792a11b6","resolution":{"observed_at":"2026-08-06T20:36:26.766654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11409","last_updated":"2024-06-19T02:37:50Z","snapshot_observed_at":"2026-08-06T23:06:20.949657Z","submitted_at":"2024-06-17T10:54:35Z","title":"CodeGemma: Open Code Models Based on Gemma","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11409","snapshot_observed_at":"2026-08-06T20:36:26.843248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.843248Z"},"links":{"cited_paper":"/paper/2406.11409","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:3d86c605a18af0df4355a0a2fdf279b0593f5235cf547cdd936106a1198cb2f3","observation_id":"154080a7-acd9-49f1-baa0-6570049a1479","resolution":{"observed_at":"2026-08-06T20:36:26.843248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-06T20:36:26.913868Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:26.913868Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:1252fe984285f3a6852cca563f148eff2a434cae97131fce7dd7b3406ba3d582","observation_id":"18994a18-11ad-47d8-9c94-d20163ad132f","resolution":{"observed_at":"2026-08-06T20:36:26.913868Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.182215Z","title":null,"venue":null,"work_id":"e7db32ac-6cd0-49df-b1fe-eed9d3f94184","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.026596Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:acf3fc9f67acb5d5afe8e1e7a5df402dd0b8014694db203d564c163573dd0458","observation_id":"08116d72-2f7a-44d8-8c6a-01676b65af29","resolution":{"observed_at":"2026-08-06T20:36:29.290418Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:29.004119Z","title":null,"venue":null,"work_id":"96849642-f79b-49eb-94ce-13f87d68c4f0","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.097866Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:1123f70b4e30e641cdabbc4d7dc5eaadb47ac87081b9c736fac4ae9a74f9e674","observation_id":"5ac8c9c6-b6fc-4b66-a96a-8dbf42a016ee","resolution":{"observed_at":"2026-08-06T20:36:29.093657Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-06T20:36:27.155039Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.155039Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:06353bb47c2695d542c2f1437b077eb8461c7a001c57fa30aa84c3082a679e22","observation_id":"fb9c526a-e209-46d6-9051-08580a693727","resolution":{"observed_at":"2026-08-06T20:36:27.155039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.766597Z","title":null,"venue":null,"work_id":"5d95c0a2-4cb2-418d-9fbb-093b72b6377d","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.201596Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:573e9087686d29c75fced6426500c7901873b586b0fb75b65f8f6f38701a0ace","observation_id":"ad6a95e2-2899-4ca1-9d59-51db2d4e0f1f","resolution":{"observed_at":"2026-08-06T20:36:28.895363Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.545859Z","title":null,"venue":null,"work_id":"3acf1c3b-4a80-4382-b6c6-66af65785ed8","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.248882Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:ce0019cc93e2d820a189f69cdcc9cb8be03b75eee40badd602da10ed4880f70a","observation_id":"53962ff8-a31b-423e-b7c2-57eebad9ac1d","resolution":{"observed_at":"2026-08-06T20:36:28.613930Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.497482Z","title":null,"venue":null,"work_id":"1fb046f7-945f-42f9-b7e7-0201067e7f13","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.303897Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:9fb013ed6a2529434d30fb74f0e40c8f0cc436465446613e332532897ba94a20","observation_id":"646e207f-db94-4995-889a-2860491650b4","resolution":{"observed_at":"2026-08-06T20:36:28.534842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.355554Z","title":null,"venue":null,"work_id":"5ab877b4-b2bb-4e4f-be80-7bd0fcf2b0c2","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.372864Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:cc02f7f73a7b10cfb9bb9bbb425e33241a1d312e4b554c615a64362ecec3187a","observation_id":"94992be1-19b6-49e6-90a4-03309f9b5532","resolution":{"observed_at":"2026-08-06T20:36:28.411944Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11508","last_updated":"2023-12-27T08:23:14Z","snapshot_observed_at":"2026-08-02T00:30:18.538738Z","submitted_at":"2023-12-12T03:30:21Z","title":"Rethinking the Instruction Quality: LIFT is What You Need","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.11508","snapshot_observed_at":"2026-08-06T20:36:27.423317Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":39,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.423317Z"},"links":{"cited_paper":"/paper/2312.11508","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:76ff02b7e804511ed3c36d1e78f187a14255d7366b392d7e79b652816e0191a8","observation_id":"464d79b7-0392-4fc9-a5be-e98f6bd022f6","resolution":{"observed_at":"2026-08-06T20:36:27.423317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-06T20:36:27.475388Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":40,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.475388Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:311dfd13257afb8d408f55d22c4f02821f5bbaaed88b457674f731c790de9322","observation_id":"b4e27a98-c314-4bf5-b2f8-d94d19ece65f","resolution":{"observed_at":"2026-08-06T20:36:27.475388Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.223914Z","title":null,"venue":null,"work_id":"531c1fe2-1b83-4b49-93fd-628ec5561606","year":2024},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":41,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.521402Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:f7b0f83612c3f43a530f4d40044739664e30403d028e3db4cd02cefcee2689fa","observation_id":"21fa1f1f-2a6b-4ee9-aeb2-ec6e6afc2462","resolution":{"observed_at":"2026-08-06T20:36:28.281943Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.122111Z","title":null,"venue":null,"work_id":"f61bd615-a6b4-4ad2-8822-7f6af2c85fd6","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":42,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.573070Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:fdd50c596c8eaa9c0252e864fc68fbcfa1bed6f9d12bb55ba1086a9463593f88","observation_id":"76e13e76-4906-4386-9b92-b60af2da2f59","resolution":{"observed_at":"2026-08-06T20:36:28.162023Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-06T20:36:28.009022Z","title":null,"venue":null,"work_id":"6b6009f3-2b37-4cc1-aff9-b5386b91abf2","year":2023},"citing_paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection","version":1},"reference_index":43,"source":"arxiv_source","source_observed_at":"2026-08-06T20:36:27.623294Z"},"links":{"citing_paper":"/paper/2507.02378"},"observation_digest":"sha256:6257a854827876cff6e2445986b4179414dda88c1871748945a76afe8fbf6ba4","observation_id":"0cc06e8f-23f6-40c0-8a4c-d6f586b7d126","resolution":{"observed_at":"2026-08-06T20:36:28.063939Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2507.02378","last_updated":"2025-07-03T07:19:56Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-06T23:06:58.931831Z","submitted_at":"2025-07-03T07:19:56Z","title":"Efficient Code LLM Training via Distribution-Consistent and Diversity-Aware Data Selection"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":43,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 1 inbound Pith citation observation for arXiv:2507.02378."}