{"as_of":"2026-08-08T04:08:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:287766e7c6bde7d9b4e6254f0cbb1b17bf20095fc6b3b08504ade5f21ea40c6b","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T12:18:41.264812Z","state":"measured"},{"denominator":60,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":60,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-07T10:05:31.211127Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-12T09:36:27.709505Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"cited_work":{"arxiv_id":"2505.24768","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2505.24768","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Xinyin Ma, Gongfan Fang, and Xinchao Wang","venue":null,"work_id":"e5f5639b-40bc-45f1-ac14-1170ee56a384","year":null},"citing_paper":{"arxiv_id":"2604.27115","last_updated":"2026-04-29T19:08:15Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2026-04-29T19:08:15Z","title":"Exploring the Limits of Pruning: Task-Specific Neurons, Model Collapse, and Recovery in Task-Specific Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-05-07T10:05:31.211127Z"},"links":{"cited_paper":"/paper/2505.24768","citing_paper":"/paper/2604.27115"},"observation_digest":"sha256:3ea67f7e350e2e089ab75509b9df305106f86124c807cdc9c3625f48501aa36e","observation_id":"28b993e3-6aa7-4e55-8b6b-1b90158b002c","resolution":{"observed_at":"2026-05-12T09:36:27.711589Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2505.24768/citation-record","integrity":"/paper/2505.24768/integrity","json":"/paper/2505.24768/citation-record.json","paper":"/paper/2505.24768"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:51.122919Z","title":"Abusamra","venue":null,"work_id":"53078097-6c39-4f94-a08c-cb56da3dce8d","year":2013},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.021687Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:54898a32ed7fc56c0b94005fb4a6ad5a8401db472e2166351d50da5b1aefd6c6","observation_id":"955e7c36-1f92-434c-b016-3492a0a3b8f5","resolution":{"observed_at":"2026-08-07T12:18:51.192083Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-07T12:18:34.113359Z","title":"Achiam, S","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.113359Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:96c0a5c5f86878a692aeaca4edccc3bc957202127aca48852a1a1bf25b973015","observation_id":"717ce4d7-b95c-43bd-a5e4-0f062df5338f","resolution":{"observed_at":"2026-08-07T12:18:34.113359Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.955944Z","title":"Arora, Y","venue":null,"work_id":"b1df9291-15a6-4ddc-87d4-e325874f9bea","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.249856Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2bbe6e1aa850550a8d880c47bf29c44c0a74e22ef0da67006e8044ea60a293d3","observation_id":"f8bc84c6-97f7-411c-9214-2e9475965232","resolution":{"observed_at":"2026-08-07T12:18:51.019565Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.788694Z","title":null,"venue":null,"work_id":"0f77f82b-5d39-46f6-bac0-555a270b0ff2","year":1996},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.353973Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:3072cf6d1e0eab89d7d63acfeff70c0538d2b9a0fdf40838d77198873696c967","observation_id":"f5945726-1847-4a80-b354-2e34692a2ce4","resolution":{"observed_at":"2026-08-07T12:18:50.860242Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:34.419589Z","title":"Brown, B","venue":null,"work_id":null,"year":1901},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.419589Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:e301d9b59d16fd4dfe2b2f8f20b3feb70345d4938a19091c86331fb7cd6963eb","observation_id":"551459cd-a9dc-4435-b4c4-6a126aeaf627","resolution":{"observed_at":"2026-08-07T12:18:34.419589Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.12712","last_updated":"2023-04-13T20:41:31Z","snapshot_observed_at":"2026-08-03T04:49:15.195814Z","submitted_at":"2023-03-22T16:51:28Z","title":"Sparks of Artificial General Intelligence: Early experiments with GPT-4","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.12712","snapshot_observed_at":"2026-08-07T12:18:34.512980Z","title":"Bubeck, V","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.512980Z"},"links":{"cited_paper":"/paper/2303.12712","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9e70a743c58624625bab9fcb0140cf644f416b63f83d58681ff1901e0a39cec9","observation_id":"c846e394-5355-499e-9802-aadefe349fff","resolution":{"observed_at":"2026-08-07T12:18:34.512980Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.596719Z","title":"Bukharin, S","venue":null,"work_id":"b941ffea-0ecc-4f02-bb8d-1cf06187e9b2","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.570337Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2a131dd25b271976522f3eafb16e1edce309f854964c96f78e574e6858af4b69","observation_id":"737f79c6-27f5-43e0-8df3-2bb219aa9dd0","resolution":{"observed_at":"2026-08-07T12:18:50.674414Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.15226","last_updated":"2024-10-22T18:54:23Z","snapshot_observed_at":"2026-07-06T19:36:32.581033Z","submitted_at":"2024-10-19T22:14:07Z","title":"On the Diversity of Synthetic Data and its Impact on Training Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.15226","snapshot_observed_at":"2026-08-07T12:18:34.656149Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.656149Z"},"links":{"cited_paper":"/paper/2410.15226","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:25725cfb3e553901aa9357132418d8989966f5283651d5ae864d667be551ac2b","observation_id":"554c546f-1901-4c8e-a9e3-7f8222d36398","resolution":{"observed_at":"2026-08-07T12:18:34.656149Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:34.756335Z","title":"Conover, M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.756335Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:e63a9980508a931992d6f109baa8fddc554ddb9c464b091055bd9bb9409b31ed","observation_id":"06de077b-a1dd-4497-9fa4-ebe572e04f41","resolution":{"observed_at":"2026-08-07T12:18:34.756335Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.336794Z","title":"Dettmers, A","venue":null,"work_id":"5b4d8d6f-c61c-4561-b899-99fb2179aee5","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.836156Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:f19041e85e04c8ab50aa89de83b14c7c49fda87574e9d021913796b2bcd11daf","observation_id":"0d13f6ae-b164-49f1-add5-9f7478dc0d63","resolution":{"observed_at":"2026-08-07T12:18:50.456617Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:50.070640Z","title":"Devlin, M.-W","venue":null,"work_id":"0b0aea59-74ec-48cf-8eb6-088f46f5b3d5","year":2019},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:34.929730Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:0d644eca679214a7545e44c9c7f40628c9a5dee9c1d2af52315eec8273f90580","observation_id":"aa72cacd-b7dd-45aa-aa25-611cbe73cc14","resolution":{"observed_at":"2026-08-07T12:18:50.154427Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.15653","last_updated":"2023-11-27T09:33:13Z","snapshot_observed_at":"2026-07-06T16:52:57.823137Z","submitted_at":"2023-11-27T09:33:13Z","title":"MoDS: Model-oriented Data Selection for Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.15653","snapshot_observed_at":"2026-08-07T12:18:35.076667Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.076667Z"},"links":{"cited_paper":"/paper/2311.15653","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:697ab0d4be5405b4918a9f60d4983504233f93ac1d56207a1e9d40520b3184b3","observation_id":"710484db-8632-42f5-8d21-7c052288458a","resolution":{"observed_at":"2026-08-07T12:18:35.076667Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T12:18:35.201938Z","title":"Dubey, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.201938Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:384e9336c4799ae934102c694e70236492969cf8d04005d0f1d870132c43c621","observation_id":"f9fabff6-de4d-4af1-beaa-399baeee24a5","resolution":{"observed_at":"2026-08-07T12:18:35.201938Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.940077Z","title":"Ester, H.-P","venue":null,"work_id":"69451ce2-4b45-442b-817b-0d5ef9710841","year":1996},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.323158Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:8bf87e28eee92bed74370e8991b31d2d47d5d68faf6d1a5c8f5c5eaf6aa0ad3a","observation_id":"60effee0-1ce6-4d18-bbf5-10eacd063fa9","resolution":{"observed_at":"2026-08-07T12:18:49.994603Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.20094","last_updated":"2025-05-08T00:24:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-06-28T17:59:01Z","title":"Scaling Synthetic Data Creation with 1,000,000,000 Personas","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.20094","snapshot_observed_at":"2026-08-07T12:18:35.482012Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.482012Z"},"links":{"cited_paper":"/paper/2406.20094","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2221129295f5c1ea9c3dd05a99ca15eaddbb0ba03e6d94adb3f40d29ecd67ed1","observation_id":"080b08cf-a195-4481-865f-e4d11a981fd5","resolution":{"observed_at":"2026-08-07T12:18:35.482012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.726109Z","title":null,"venue":null,"work_id":"e018f531-489f-4557-aa9b-76a93d7d6f11","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.663000Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:69b835c77d46f22588f7096fce04e75402dd36d0246178e5f931557b4fe15489","observation_id":"4e5443b1-dead-4a1e-988e-e9bdb97244e9","resolution":{"observed_at":"2026-08-07T12:18:49.850917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2203.05794","last_updated":"2022-03-11T08:35:15Z","snapshot_observed_at":"2026-07-06T12:46:41.057346Z","submitted_at":"2022-03-11T08:35:15Z","title":"BERTopic: Neural topic modeling with a class-based TF-IDF procedure","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.05794","snapshot_observed_at":"2026-08-07T12:18:35.800342Z","title":"Grootendorst","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.800342Z"},"links":{"cited_paper":"/paper/2203.05794","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:234b3ac9a2ac04e685d4cfb224e65df008cd003852a3a6616ad9a9f776b42ad4","observation_id":"be3f877c-a946-435b-84e6-2224f489edac","resolution":{"observed_at":"2026-08-07T12:18:35.800342Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.552023Z","title":"Hendrycks, C","venue":null,"work_id":"90fa4298-a208-402b-b7e7-2db3f7811f11","year":2021},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:35.949556Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:cb7181e54f3e5f27e3c3bcd4d9d780dae164bc2b739f68b26be8a2d7efd40322","observation_id":"7996592b-5a05-4399-9716-6fbd8d183a04","resolution":{"observed_at":"2026-08-07T12:18:49.627835Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.326436Z","title":null,"venue":null,"work_id":"c2736ebf-b331-41f6-b416-3bf92f02117d","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.057962Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d2b596bdec01eba707a8ba12421a413aa9927d4fe521d684ba767d92b0aaac35","observation_id":"ad6252ba-edf8-4ef7-bb8a-daeb38ef0755","resolution":{"observed_at":"2026-08-07T12:18:49.439901Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2001.08361","last_updated":"2020-01-23T03:59:20Z","snapshot_observed_at":"2026-07-06T08:52:12.656082Z","submitted_at":"2020-01-23T03:59:20Z","title":"Scaling Laws for Neural Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2001.08361","snapshot_observed_at":"2026-08-07T12:18:36.169502Z","title":"Kaplan, S","venue":null,"work_id":null,"year":2001},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.169502Z"},"links":{"cited_paper":"/paper/2001.08361","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:895d9fe7bb8ae23af9144fd73301b5bf90726e2bd24a57f74dba79f097bc89db","observation_id":"ca96da29-fcef-4402-92b2-77947166f424","resolution":{"observed_at":"2026-08-07T12:18:36.169502Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:49.057026Z","title":"Land and M","venue":null,"work_id":"09b156ce-f34e-4b0a-9351-6900e9384ea4","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.289952Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:dbc7ef356795ab3957cfa4033ab30db90473af8e2995ff5cc322302f7abb4b9d","observation_id":"3d6a9142-d21c-4809-ad2d-40f6d0786b82","resolution":{"observed_at":"2026-08-07T12:18:49.164629Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.902563Z","title":null,"venue":null,"work_id":"3077f6ea-9e63-4d27-95e5-eccf7ac84801","year":2016},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.439983Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:885aeba4d1b05ccc9c4ec2c2bda31cfb3fd7a9a6164326d294244acf455809f5","observation_id":"a06dec65-040f-405c-b28c-1684acf703e1","resolution":{"observed_at":"2026-08-07T12:18:48.966854Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-02T11:33:41.297984Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-07T12:18:36.565098Z","title":"Li, W.-L","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.565098Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:fa993d95512218f8d2629b36af528109c74f539fd7e0b1dfdf41d4bf0592bc8c","observation_id":"7abcd1b7-659a-40d8-a6c8-ee4a52fcda08","resolution":{"observed_at":"2026-08-07T12:18:36.565098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.697641Z","title":null,"venue":null,"work_id":"105c2896-bb96-4994-9a81-cdc3ec44e03f","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.682751Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:6c40a7ed60b5cf7fb2b52cf4b43695bc49e0f82aea5a6d553b9258e44f074509","observation_id":"a4452475-b262-4556-afe4-20cd8f055f1d","resolution":{"observed_at":"2026-08-07T12:18:48.796672Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.546520Z","title":null,"venue":null,"work_id":"04e1e142-51b3-4cea-a17d-821797d4e916","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:36.844907Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:0d2a59318653f614434c19d72f3989adfbd1344f35507da2e578261b2f7b5cc6","observation_id":"ba91417e-8fd3-4316-b1c0-49f97c5cfdc5","resolution":{"observed_at":"2026-08-07T12:18:48.613355Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:48.280831Z","title":null,"venue":null,"work_id":"bf9ca499-fef6-4585-9c6e-fc4b5273203f","year":2004},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.003655Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:aa5a707362dac10c0e97842ed64865bb8d268d6ec812e7bea372ecddb0e33149","observation_id":"f47b8f2a-da25-4b55-a873-f5e3fbc9c293","resolution":{"observed_at":"2026-08-07T12:18:48.430581Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.988114Z","title":null,"venue":null,"work_id":"df0f2e83-1c77-4cd3-aac3-1b8694fdb54c","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.143731Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:4c09e8cd5eddb5f8ecd8dd793b70a2110a45ea104a934d68a036df3b6b684352","observation_id":"634648bb-e76a-48fa-b471-89b76272a90f","resolution":{"observed_at":"2026-08-07T12:18:48.100495Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.741356Z","title":null,"venue":null,"work_id":"1567f8d8-03f0-49fa-8f45-53bb0d3e37aa","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.282654Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:4702a7be6b60d51225ad8bd26e40888adce754b6a21644724e57609a85be0911","observation_id":"72b4bc12-a1c6-40c5-95a1-42a3ab23baf1","resolution":{"observed_at":"2026-08-07T12:18:47.864115Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.582615Z","title":null,"venue":null,"work_id":"2896ed71-d711-41bb-8c3c-6039b3af68a7","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.416374Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:959d3e40e514f2135f50fa24db913c98753dbd2f4933dccb392a4558ca04128a","observation_id":"a0acb435-2cfd-456a-a10e-1cec52faee56","resolution":{"observed_at":"2026-08-07T12:18:47.651649Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:47.262759Z","title":null,"venue":null,"work_id":"e27aca68-0b7c-40d3-903b-dccabb2d9a49","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.528974Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9013b3e027c0ce2c22adfa566c4a784ff43b97124f634b11507986fa2fe356cb","observation_id":"534e35b9-5480-4e5f-8889-627309e79337","resolution":{"observed_at":"2026-08-07T12:18:47.399593Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.960004Z","title":"Madsen, N","venue":null,"work_id":"8be19f01-bf55-4311-8054-42d91384d661","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.685609Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:0b75aca664a024ee42a18cade3231801edd9054816b66826cf68342d29a7eb20","observation_id":"823e59dd-5d86-45e6-b463-3e8f7e42f74c","resolution":{"observed_at":"2026-08-07T12:18:47.096845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.755631Z","title":"McInnes, J","venue":null,"work_id":"3aec71cb-0dda-4c8a-b8db-cb42c0564d15","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.847883Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:adbf50454f0203faa47416fb0241f211e769cdb178127fa318c093396a14250b","observation_id":"a84192bb-e9d0-4578-9dce-be2cfa803a73","resolution":{"observed_at":"2026-08-07T12:18:46.838817Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:37.980820Z","title":"McInnes, J","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:37.980820Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9e0bed03e5bc6ae2a424ba3fc5321a02c0f1c20d7def46cfcbd38337641808f1","observation_id":"beb33b9f-c489-4ccf-bd0f-2e0a93c75d6c","resolution":{"observed_at":"2026-08-07T12:18:37.980820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.414483Z","title":"Mikolov, I","venue":null,"work_id":"4b73eed0-a072-46ac-b81e-f96960d105e2","year":2013},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.104984Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:2188fb1995e01d58f530d1211df9ac786bf03c1df1d350c5c34d4b295221dbb4","observation_id":"c5c0fcc7-ff05-4a0e-9cda-deab31ffa940","resolution":{"observed_at":"2026-08-07T12:18:46.580853Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:46.125792Z","title":"Ouyang, J","venue":null,"work_id":"d11f935c-ccfd-40f0-970c-e75e710bca6e","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.229914Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:11b21e7a740c41700bdcd3bb8417eb9d9c264aa401ac0514afe040dc979672e8","observation_id":"07056bf5-431e-4eaa-87bf-b8785428d642","resolution":{"observed_at":"2026-08-07T12:18:46.252330Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.822204Z","title":"Padmakumar and H","venue":null,"work_id":"612c685d-2230-4b84-8e42-632e6fd3a3f9","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.346730Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:07ac12897b319169cb6d767871c887208ccc1f3535b2b99c2e900369042710a9","observation_id":"fd688051-1303-4683-8999-7b79873e5281","resolution":{"observed_at":"2026-08-07T12:18:45.942175Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:38.465739Z","title":"Shaib, J","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.465739Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9886b7f3cad8218b4b728ddcff5e7a06208468dde6139345b61daae5b596da87","observation_id":"1db9efa1-332a-4989-b442-4a13a1101edc","resolution":{"observed_at":"2026-08-07T12:18:38.465739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.572291Z","title":null,"venue":null,"work_id":"cf81a7a1-bbbc-42fa-8c01-40b7ee17f8ce","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.654230Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:97fe3d28870ef2bd7ea739b0abca6e933f133330e496133b0dbacd1bc3ead9b0","observation_id":"3497c890-2ac6-4274-b492-64fe1255d435","resolution":{"observed_at":"2026-08-07T12:18:45.668676Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-07T12:18:38.774435Z","title":"Touvron, L","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.774435Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:9ed1fb264b44c5905598225f96c820ec4444bb54ff47d56ed7709b4712c9a185","observation_id":"106218ef-91bc-425e-93ee-813da3a1fdbc","resolution":{"observed_at":"2026-08-07T12:18:38.774435Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:45.293662Z","title":"Vaswani, N","venue":null,"work_id":"a5934128-d749-40bc-a9ba-bd4c6750bd18","year":2017},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.885518Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:b5eb803f4bc5ce794e726aa7e492758f1ef0f64f0b81ddaa8c233e3d44c88281","observation_id":"d483f112-799c-4a99-a9f6-ac75ee7edfd1","resolution":{"observed_at":"2026-08-07T12:18:45.437292Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.02318","last_updated":"2024-02-04T02:09:43Z","snapshot_observed_at":"2026-07-06T17:24:57.402088Z","submitted_at":"2024-02-04T02:09:43Z","title":"Diversity Measurement and Subset Selection for Instruction Tuning Datasets","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.02318","snapshot_observed_at":"2026-08-07T12:18:38.961826Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:38.961826Z"},"links":{"cited_paper":"/paper/2402.02318","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:eda6c5a1d583cb05f8533c62dc1c164dfd40182df950e7ac8029c42caee8eb7e","observation_id":"1754211a-5a7a-4b60-9ec2-197ae4a9fcae","resolution":{"observed_at":"2026-08-07T12:18:38.961826Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.982127Z","title":null,"venue":null,"work_id":"5d613bf7-e052-4f7f-957b-03039e10eb7a","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.071679Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:c8c2578048dab2a2c7418876306604d64700d79c62203f572b5709dd2b1c7ba6","observation_id":"ffcba2e2-e2d3-4bae-8d67-0d2a4c9f3f62","resolution":{"observed_at":"2026-08-07T12:18:45.113485Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.01257","last_updated":"2025-03-06T12:13:14Z","snapshot_observed_at":"2026-07-06T19:25:42.156795Z","submitted_at":"2024-10-02T06:05:52Z","title":"HelpSteer2-Preference: Complementing Ratings with Preferences","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.01257","snapshot_observed_at":"2026-08-07T12:18:39.220697Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.220697Z"},"links":{"cited_paper":"/paper/2410.01257","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:c3cfe46161d37df7655ef4e1606ec7306dc924322e6322fe9ec2bc7346dc6f95","observation_id":"42666668-3a53-487f-97a0-02efe5af086b","resolution":{"observed_at":"2026-08-07T12:18:39.220697Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.698781Z","title":null,"venue":null,"work_id":"e08c7c89-e615-4f8f-9f01-ad37ebf460e9","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.348003Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d45fd80b745588621e67b14671e7ad901a3422120c13a7b947b9c32f5e1b27fc","observation_id":"82776c4b-0e63-4f41-a97c-be8e174dee1e","resolution":{"observed_at":"2026-08-07T12:18:44.863180Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.434911Z","title":"White, S","venue":null,"work_id":"af0cdc5e-56ea-4036-b2b9-5933a684afa9","year":2025},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.484874Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:27da932d507b5e6155aa63bafe5d375614ec4efcd2d9682693225099a55bde62","observation_id":"eebeced9-6c32-4984-a22a-b7e7dcdb9346","resolution":{"observed_at":"2026-08-07T12:18:44.540924Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:44.147339Z","title":null,"venue":null,"work_id":"27605b06-afd5-4af2-9813-01b8c4fed369","year":2022},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.605411Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:27651d6f5d0c3915ad93a6d0b24dfe4add0548584552caaf936d005827db224f","observation_id":"c2391c85-a538-4fc1-9d09-794d533bb8e4","resolution":{"observed_at":"2026-08-07T12:18:44.254301Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T12:18:39.764845Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.764845Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:49ecddbcf374dcbe1093b3b9139b74e8e64c56bc6608f1a8d3fc39af28700668","observation_id":"29db87e5-708c-497e-b70f-d39cd8849ac3","resolution":{"observed_at":"2026-08-07T12:18:39.764845Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.909724Z","title":"Zhang, S","venue":null,"work_id":"0ef1b85a-f796-4d7d-bcc7-2c0e3b90dcb9","year":2020},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.892103Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:8f4cf7e44e0b0fd23adac8ec1cb7f48a9fa0ee7187313215e8305fad0243b623","observation_id":"d40d78b2-934f-4b42-b491-87a1fd17bd57","resolution":{"observed_at":"2026-08-07T12:18:44.025611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.717650Z","title":null,"venue":null,"work_id":"c5395c92-65d0-4b34-bf70-e9105ad69ac5","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:39.966787Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:619fd1c801859504cdea3b29565a2b6ab9259f2fbdab4d332f6346d5a01e49d5","observation_id":"dabb8945-a7a8-45b2-b9ab-a40e295dbdf2","resolution":{"observed_at":"2026-08-07T12:18:43.796761Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.399102Z","title":null,"venue":null,"work_id":"73123933-0284-4050-8e78-601eb8c7d1b5","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.130686Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:e5ac55e6cd9dd239ddf4cb684259ebea5ef94faa629cc2bbbce366651cde8998","observation_id":"0532fc73-02b4-4ea6-9d68-b87d946a76f3","resolution":{"observed_at":"2026-08-07T12:18:43.555753Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:43.124135Z","title":"Zheng, R","venue":null,"work_id":"4f76d4f5-69f0-4830-9a3a-0d02170d2a64","year":2024},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.248596Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:352e7974ba625d0501aef065e18c1346c041ccd9b8ad7b2ac0af36a3a1418c98","observation_id":"a4e0a418-08c7-4b63-88ec-4280baa1e1db","resolution":{"observed_at":"2026-08-07T12:18:43.267479Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.863829Z","title":"Zhong, L","venue":null,"work_id":"60c60a80-98f7-4943-a6b7-50628d8bb2dc","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.372496Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:880a37862bae0bf778cc11c0c35cb2dc1626b94a0019a1acb66a3ed4c7b6eb3d","observation_id":"58a3e2d1-c745-4420-897c-50b415c90178","resolution":{"observed_at":"2026-08-07T12:18:42.996020Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.583682Z","title":null,"venue":null,"work_id":"3d9c93c0-9c70-44d4-b206-a12472375748","year":2023},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.487494Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:bb440f42e0521c56c55faa716fc1faec587dae54382e6f46d2c101f663b32662","observation_id":"da7f78fc-11fc-443f-920b-ab369b102c8f","resolution":{"observed_at":"2026-08-07T12:18:42.735529Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:42.263520Z","title":"important tokens","venue":null,"work_id":"93f0e22b-6186-4510-9000-a5944c7f5052","year":2018},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.606154Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:0722c0014770b98d29da2a64772a62705724a360711733d5aa478ab57490c97e","observation_id":"aeeb8243-7b0b-40f7-8557-9443b7fc360e","resolution":{"observed_at":"2026-08-07T12:18:42.401530Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.726509Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.726509Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:77564922010aac068d255b8985de7f97846105985ac59a52deb29901349dc4a9","observation_id":"13cfecf6-16af-404a-a6f1-a4eab20edecb","resolution":{"observed_at":"2026-08-07T12:18:40.726509Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.837519Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.837519Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:e1b62512150dfb1c5dc6ca3224bb9c5a63311d2be72014d46954eb36ce7cb378","observation_id":"72983e3a-96ed-4085-94ef-69e07dc82984","resolution":{"observed_at":"2026-08-07T12:18:40.837519Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:40.965271Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:40.965271Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:87a5e61fb6db1e0e3b141f7bb29fd49e7211df9c001ad61557c479e9ab0ffb4a","observation_id":"7cfeac98-459f-4bcf-9cde-244c57e9b178","resolution":{"observed_at":"2026-08-07T12:18:40.965271Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:41.124019Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:41.124019Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:5a33f93519a37275be824bd2a20c4e605014c198f44318114172dcfe3d6be4cb","observation_id":"ba3d3b17-164b-498e-98b2-0a9e0830c276","resolution":{"observed_at":"2026-08-07T12:18:41.124019Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T12:18:41.989923Z","title":"Spelling and Grammar Check","venue":null,"work_id":"dd324bec-33af-4333-ab3c-f84aec85b23d","year":null},"citing_paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T12:18:41.264812Z"},"links":{"citing_paper":"/paper/2505.24768"},"observation_digest":"sha256:d2bd29d345a2a17f4823ef1b8929927bb14258d83d93ff330f9dbe7ac468c39a","observation_id":"44889bba-3a7e-4a1d-bab2-7fec148fe107","resolution":{"observed_at":"2026-08-07T12:18:42.062444Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2505.24768","last_updated":"2025-05-30T16:31:05Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-07T12:11:53.994747Z","submitted_at":"2025-05-30T16:31:05Z","title":"From Macro to Micro: Probing Dataset Diversity in Language Model Fine-Tuning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":39,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 1 inbound Pith citation observation for arXiv:2505.24768."}