{"as_of":"2026-08-08T18:47:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5f0170f08821a60966de910c7bd3946d87002a11d5da7dead87a5aaaebaa94e5","coverage":[{"denominator":43,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":43,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T00:15:36.766601Z","state":"measured"},{"denominator":43,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":43,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.15021/citation-record","integrity":"/paper/2506.15021/integrity","json":"/paper/2506.15021/citation-record.json","paper":"/paper/2506.15021"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:33.334830Z","title":"Language models are unsupervised multitask learners, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.334830Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:d29b6f9bfb5fe2720b21a359ce859b43b329b2f3a2aa92bb647c7d09cc35f936","observation_id":"2f6ea8e5-91f9-4ed8-9bef-c1eb274cb3d3","resolution":{"observed_at":"2026-08-07T00:15:33.334830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.319680Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":"f2f9a5da-76fc-45da-aff8-993a018bbab1","year":2022},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.400969Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:e4b2081ab1407defe03d237b2052dc5aa91d07cdc76fbc471d994f48122157ed","observation_id":"0af794cf-7079-4352-a7e5-d592d01402d3","resolution":{"observed_at":"2026-08-07T00:15:39.322815Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:33.511413Z","title":"Llama: Open and efficient foundation language models, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.511413Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:784335498bedff646034c48721f44674002fccefefa171558d84b4ef7c1a9c31","observation_id":"90d6d3ec-593f-416a-8798-084b6717f7dd","resolution":{"observed_at":"2026-08-07T00:15:33.511413Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-08T12:58:42.430328Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-07T00:15:33.633471Z","title":"T\\\" ulu 3: Pushing frontiers in open language model post-training.arXiv preprint arXiv:2411.15124, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.633471Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:d8a42e591816e5145c1d21dc549dc535f31f25b5009e6b0f175954413dc348f4","observation_id":"b1f89571-40c8-4ca5-b607-d318470bdebc","resolution":{"observed_at":"2026-08-07T00:15:33.633471Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:33.744767Z","title":"LIMA: Less is more for alignment","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.744767Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:594033fc1f81fd9ad53b465f11cfdde4025d6ede03439b367526b2596e465669","observation_id":"639c38ff-6208-4c90-84fb-8a2a24bda692","resolution":{"observed_at":"2026-08-07T00:15:33.744767Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08673","last_updated":"2024-06-12T22:28:08Z","snapshot_observed_at":"2026-08-08T14:41:39.335795Z","submitted_at":"2024-06-12T22:28:08Z","title":"HelpSteer2: Open-source dataset for training top-performing reward models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08673","snapshot_observed_at":"2026-08-07T00:15:33.902602Z","title":"Helpsteer2: Open-source dataset for training top-performing reward models.arXiv preprint arXiv:2406.08673, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:33.902602Z"},"links":{"cited_paper":"/paper/2406.08673","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:fc8fa858aa953d4b27e1c69bb21a1d4a0ffff67e230ed3b9787508669c3faa9e","observation_id":"0eb732b7-d282-465f-b157-e4328d374676","resolution":{"observed_at":"2026-08-07T00:15:33.902602Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.273561Z","title":"From quantity to quality: Boosting LLM performance with self- guided data selection for instruction tuning","venue":null,"work_id":"4b0da5f1-6aca-45ef-920c-e95eb210f04a","year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.033934Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:ddc4f3598eb412a31195aead2d7b12fd4fb3118a5396e6c3e25e2c9c4619a6a0","observation_id":"5fd366d3-1af2-4a23-ad42-b8e4bf24da9c","resolution":{"observed_at":"2026-08-07T00:15:39.282741Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.157194Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.157194Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:79c87109bfb3adae1be8abed94d8b6bd28f88d6ef5a70408d799e1bf13367bae","observation_id":"16735af5-2458-4c1f-bc96-46dad00fd616","resolution":{"observed_at":"2026-08-07T00:15:34.157194Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.248114Z","title":"Vicky Zhao, Lili Qiu, and Dongmei Zhang","venue":null,"work_id":"3e09050a-bfd6-463a-9f66-9eb5cb1de113","year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.209061Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:c7d24fb352762a08ceb10fdec4c6fe21cd1d479873e7ba645676e4f88e9bdd65","observation_id":"bedcebf7-efaf-426a-8ff7-ff46c6e11a8e","resolution":{"observed_at":"2026-08-07T00:15:39.257528Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2404.07965","last_updated":"2025-01-08T09:07:54Z","snapshot_observed_at":"2026-08-07T08:00:00.868748Z","submitted_at":"2024-04-11T17:52:01Z","title":"Rho-1: Not All Tokens Are What You Need","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.07965","snapshot_observed_at":"2026-08-07T00:15:34.227513Z","title":"Rho-1: Not all tokens are what you need.CoRR, abs/2404.07965, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.227513Z"},"links":{"cited_paper":"/paper/2404.07965","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:c2800b4408e2615ca56d57f301d976cbc898b0ac8b4c395073f25e6caffdd2b6","observation_id":"97c019cf-d445-45f6-b6bb-9652cfd16282","resolution":{"observed_at":"2026-08-07T00:15:34.227513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.244752Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.244752Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:f972472e277507a4c8389243a65ac064cc1dc0a2c012cf1332bddd0f86ec4f9c","observation_id":"3cd78126-291e-4e3c-b688-61f557d5c45b","resolution":{"observed_at":"2026-08-07T00:15:34.244752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.294300Z","title":"Attention is all you need.Advances in Neural Information Processing Systems, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.294300Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:44442c2f8f3d8163c6726956b6bd2e390c237a5d62d9c7a5719d189cec41a55c","observation_id":"d9a7c82d-7b1d-4682-8dae-9330c5afceed","resolution":{"observed_at":"2026-08-07T00:15:34.294300Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1902.10186","last_updated":"2019-05-08T18:05:56Z","snapshot_observed_at":"2026-07-06T07:35:40.542174Z","submitted_at":"2019-02-26T19:59:15Z","title":"Attention is not Explanation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1902.10186","snapshot_observed_at":"2026-08-07T00:15:34.330401Z","title":"Attention is not explanation.arXiv preprint arXiv:1902.10186, 2019","venue":null,"work_id":null,"year":1902},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.330401Z"},"links":{"cited_paper":"/paper/1902.10186","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:f62ee57c6e65823cbbe320b3dc095d5a9541cbfa9e25dcac63eb170e491a26e5","observation_id":"1082ad26-eb27-4d1b-b308-b60ee3b04d18","resolution":{"observed_at":"2026-08-07T00:15:34.330401Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.04626","last_updated":"2019-09-05T14:11:27Z","snapshot_observed_at":"2026-07-06T08:14:07.617152Z","submitted_at":"2019-08-13T13:15:04Z","title":"Attention is not not Explanation","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.04626","snapshot_observed_at":"2026-08-07T00:15:34.354768Z","title":"Attention is not not explanation.arXiv preprint arXiv:1908.04626, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.354768Z"},"links":{"cited_paper":"/paper/1908.04626","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:88ecfa2352c338874e43dd2811752f9f099de1f3a769e6cccf676b4f878eaa78","observation_id":"628978c8-1aec-4325-a7eb-6c18888c27ef","resolution":{"observed_at":"2026-08-07T00:15:34.354768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.213993Z","title":"LLMLingua: Com- pressing prompts for accelerated inference of large language models","venue":null,"work_id":"dfd4bcc9-c966-43e0-8365-19af2660b9d6","year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.385487Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:70c396b9bf78c0700ab6b3f5d70e41a38a4ae43dcaac01d586dd1be6e7d246b9","observation_id":"6017cb32-3d7d-4c4d-bdb4-0f4955bb9c55","resolution":{"observed_at":"2026-08-07T00:15:39.217331Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.203792Z","title":"LongLLMLingua: Accelerating and enhancing LLMs in long context scenarios via prompt compression","venue":null,"work_id":"1f339d5f-d0df-42e0-b3e4-e82e8614e627","year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.389086Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:c6d377618522a1dadb92a51ca9e4adfafe0ddbe354d2599ea69d490f27aacc79","observation_id":"7f63348b-0052-462d-97f9-f161c45f6086","resolution":{"observed_at":"2026-08-07T00:15:39.207781Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.193908Z","title":"Learning to compress prompts with gist tokens","venue":null,"work_id":"10f4bb58-8fcb-44db-b73a-eed5b2ba8588","year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.392575Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:89d8bad9fa1cbe3334e234c237b6b7ce75fbdbd2dbf9625269c47f614439488e","observation_id":"7fdd8e2a-c1ce-47ee-a5df-0cf52bf60596","resolution":{"observed_at":"2026-08-07T00:15:39.197157Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.183368Z","title":"annotator rationales","venue":null,"work_id":"9ba316ea-c939-4530-ab27-98893a04a5d0","year":2007},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.404754Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:516fc392029ecf44d57200be16a79f070a00889d485aea9cab48e191560926ab","observation_id":"05b5fa50-e0c3-4e43-8a37-10eb6ad32660","resolution":{"observed_at":"2026-08-07T00:15:39.186302Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.157468Z","title":"Rationale-augmented convolutional neural networks for text classification","venue":null,"work_id":"8b52a1ef-ec5b-4a2a-8c33-7d8316a66eb4","year":2016},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.440215Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:7940366f72ab35085777c900ab98435708d9480d36f3a8f410e25d113cb73db3","observation_id":"66934d10-90fc-4ec8-a4cf-8db5e56752a3","resolution":{"observed_at":"2026-08-07T00:15:39.164185Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1808.09367","last_updated":"2018-08-28T15:38:41Z","snapshot_observed_at":"2026-07-06T06:57:51.694921Z","submitted_at":"2018-08-28T15:38:41Z","title":"Deriving Machine Attention from Human Rationales","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1808.09367","snapshot_observed_at":"2026-08-07T00:15:34.464838Z","title":"Deriving machine attention from human rationales.arXiv preprint arXiv:1808.09367, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.464838Z"},"links":{"cited_paper":"/paper/1808.09367","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:7ba3a47155bbf4e0c1dd6376b2ae4a6bf7537bbb9ada65254ea4f4b7b6696a74","observation_id":"4013b4fe-c364-4c58-ba68-e5d6aa9d7bc1","resolution":{"observed_at":"2026-08-07T00:15:34.464838Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.138112Z","title":"Token-level adaptive training for neural machine translation","venue":null,"work_id":"a78f8c54-4a6a-4a90-990d-d4b69c1eebb2","year":2020},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.514750Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:973a460862a6e060d46a4755723df3f4d57476e9a6ef4b82ccf69be7a4e4af4a","observation_id":"387780ae-0d4a-46cc-9162-03445a2aadc5","resolution":{"observed_at":"2026-08-07T00:15:39.143166Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.092142Z","title":"Re-weighting tokens: A simple and effective active learning strategy for named entity recognition","venue":null,"work_id":"630bd199-df6d-4aea-8fce-b34369ae81f6","year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.590858Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:a78f9ffac07f2497447b4a2ea51b466dc168fe80ac26101caccdac4cdd2c6dc7","observation_id":"129e3a54-3c76-41a9-a705-a18d51502a8c","resolution":{"observed_at":"2026-08-07T00:15:39.115977Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:39.032797Z","title":"Not all tokens are what you need for pretraining","venue":null,"work_id":"adfaab44-9de2-4513-8e05-aa5dcd2dfc9e","year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.593823Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:6b2f0e118ac979869d02b7b7bcd022956b70d7af20ead64cf1e2ac837bfb19a0","observation_id":"8e081174-01a3-4617-a931-699e27312db1","resolution":{"observed_at":"2026-08-07T00:15:39.052021Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.995488Z","title":"Does distributionally robust super- vised learning give robust classifiers? InInternational Conference on Machine Learning, pages 2029–2037","venue":null,"work_id":"f5977e01-9c87-47e7-9eeb-103f1ae1cb19","year":2018},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.605860Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:4478ed90a3606be2291009cb82f611830232234eba0913c764f7ac33fc7388ec","observation_id":"35f638b4-407a-4229-83cb-773a97ec2c73","resolution":{"observed_at":"2026-08-07T00:15:39.010417Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.967628Z","title":null,"venue":null,"work_id":"704a2bad-3d3d-48cd-9f07-8efc56c0fe62","year":2018},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.655250Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:404aa020cc85124edb843e1e58cf35ed121be5d63c1483b6f4da03fcc91aab38","observation_id":"85731c0f-a266-40f5-ab77-a69ad2613c42","resolution":{"observed_at":"2026-08-07T00:15:38.984312Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.912282Z","title":"Distributionally robust losses against mixture covariate shifts.Under review, 2(1), 2019","venue":null,"work_id":"3f1c9eed-4ec6-4601-a7db-4a027e053e01","year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.761324Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:38760b80ef9e2eb413345074f3311cfba06caa4ca9fd8b8ca97581022c2863f9","observation_id":"515f7b46-6fea-40a8-aac8-340b8a84413c","resolution":{"observed_at":"2026-08-07T00:15:38.915776Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.889631Z","title":"Distribu- tionally robust logistic regression.Advances in neural information processing systems, 28, 2015","venue":null,"work_id":"41ecdaf1-74e1-4eea-a937-887e5b9e1e80","year":2015},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.839989Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:55554ca5c7c1b015b2443e95f6fa2aa7f6f848afd32aa9c14ed91ba27f4c4a91","observation_id":"178c12d1-c44a-4be2-8d2e-60cafa9060b2","resolution":{"observed_at":"2026-08-07T00:15:38.895202Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.877356Z","title":"Variance-based regularization with convex objectives","venue":null,"work_id":"693d18ea-9d14-4c23-a25f-b5cb78b8e56b","year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.887067Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:99f3d6869958655e46b7dfd735ffe20b42b085ad24d5ad9cca7b1a48e55ccc4d","observation_id":"a424a0b5-85a1-420a-9016-ab5ae0ee3c9e","resolution":{"observed_at":"2026-08-07T00:15:38.880501Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.821853Z","title":"Hashimoto, and Percy Liang","venue":null,"work_id":"08c97e6c-2922-4bd9-8f12-5ce67fa6bf1d","year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.974756Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:00cc034e6ab19b584852c0ec999e69a0915d769f5f6a4e8702877d64ed4a69dc","observation_id":"ee7ba7e4-15c7-4871-b17c-2133a14198f9","resolution":{"observed_at":"2026-08-07T00:15:38.863893Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.588535Z","title":"Compressing context to enhance inference efficiency of large language models","venue":null,"work_id":"b82eeb19-f0fc-49ed-a406-f6586c70e8e1","year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.066631Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:6460fcbf736da0859a9e4f98b553dbc0b31c98c9ecd081d2f9b11add6eac506d","observation_id":"84d85cf8-f229-4083-951b-0de24866c02f","resolution":{"observed_at":"2026-08-07T00:15:38.692811Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-07T00:15:35.164840Z","title":"The llama 3 herd of models.arXiv preprint arXiv:2407.21783, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.164840Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:cbf61f0f5497ddf4711b4535af4e08a420e75755978a38b2fdf779027277bbb7","observation_id":"9fdfc146-cab3-4569-aeb3-834d57ce1071","resolution":{"observed_at":"2026-08-07T00:15:35.164840Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:35.315441Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.315441Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:11797dd4452513a3d21ea7ae8a8d4c992fbd9402a373c6899ee78644355d46a2","observation_id":"73a37d50-11c8-43e7-ac2f-b64813b90a97","resolution":{"observed_at":"2026-08-07T00:15:35.315441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.301064Z","title":"MathQA: Towards interpretable math word problem solving with operation-based formalisms","venue":null,"work_id":"eb2aaafc-f0b2-40d5-971e-77548ed6f94d","year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.473059Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:894f067e6f2d8490055ce43359b4c91f45483c97b6aef72522923861c8a53878","observation_id":"6fe631a6-8938-4a29-99ed-70c8e4489aae","resolution":{"observed_at":"2026-08-07T00:15:38.445334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:35.615301Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.615301Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:8ef3e9285d1deb4708d5019705e86097d6371eb4810c2d01adfdc906f868310d","observation_id":"4514aa4f-339a-409f-bf46-6e236c49719f","resolution":{"observed_at":"2026-08-07T00:15:35.615301Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:35.755536Z","title":"Can a suit of armor conduct electricity? a new dataset for open book question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.755536Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:c7483c677c93f287e2fe2265ddc16e54d364f75bf2c5db38f6a9a84098c0fb10","observation_id":"dca10006-b001-4e18-b4b9-e92bee60695c","resolution":{"observed_at":"2026-08-07T00:15:35.755536Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:35.886334Z","title":null,"venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:35.886334Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:531bb46b6c2027b0f3fc09dbd4231cb9eba71b5478a378ce395abce9c822dc78","observation_id":"21b93b94-1700-4a91-83f5-c07973240670","resolution":{"observed_at":"2026-08-07T00:15:35.886334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:38.030081Z","title":"TruthfulQA: Measuring how models mimic human falsehoods","venue":null,"work_id":"21b742ad-1086-4294-840c-505a63375046","year":2022},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.038269Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:962ed58d7be5498680f1438a7d6fa8f5b0e30df58acaec44b649b5be119958cb","observation_id":"0f7393c6-7966-4dae-ad50-6c1f481668e7","resolution":{"observed_at":"2026-08-07T00:15:38.135311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-07T00:15:36.225308Z","title":"Instruction-following evaluation for large language models.arXiv preprint arXiv:2311.07911, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.225308Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:c709b1d2a9d5933957aae29a5d38c05c11421958e6e92e38e7f0579539ffdd86","observation_id":"e2cdaf1e-283b-42cc-a19d-62ef6dae26a4","resolution":{"observed_at":"2026-08-07T00:15:36.225308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:36.340118Z","title":"Decoupled weight decay regularization","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.340118Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:d7820a536fb61f69b36e744bcb6e0ccc50915994ea7e795734f03f168007a346","observation_id":"60e51883-83da-48d0-9cd7-c798f130e249","resolution":{"observed_at":"2026-08-07T00:15:36.340118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.784433Z","title":"Nemirovski, A","venue":null,"work_id":"ec05d738-be08-4618-a5c5-c756718419d6","year":2009},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.474477Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:cea0f8dff4d3b21a5c4d8398325205a1df9472c1c5ad1035af6b9545c8f70f60","observation_id":"29619589-8854-4785-ac52-7b86065bf2c1","resolution":{"observed_at":"2026-08-07T00:15:37.897717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:37.508812Z","title":"Learning to solve routing problems via distributionally robust optimization.Proceedings of the AAAI Conference on Artificial Intelligence, 36(9):9786–9794, Jun","venue":null,"work_id":"e3c6e9b3-6e6a-4bff-9be0-a4fe61c944f6","year":2022},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.605434Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:902f9aefd1e8c3c5e34ea57b03bc6474708ec5cb84033342e393e0b866f67a52","observation_id":"70a7fca3-e630-46bc-bfa8-27532168b84b","resolution":{"observed_at":"2026-08-07T00:15:37.617568Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.02505","last_updated":"2023-03-04T21:20:58Z","snapshot_observed_at":"2026-07-06T14:58:44.419522Z","submitted_at":"2023-03-04T21:20:58Z","title":"Investigating Group Distributionally Robust Optimization for Deep Imbalanced Learning: A Case Study of Binary Tabular Data Classification","version":1},"cited_work":{"arxiv_id":"2303.02505","doi":null,"metadata_source":"pith","pith_arxiv_id":"2303.02505","snapshot_observed_at":"2026-08-07T00:15:36.977746Z","title":"Investigating Group Distributionally Robust Optimization for Deep Imbalanced Learning: A Case Study of Binary Tabular Data Classification","venue":"cs.LG","work_id":"30555b8d-53d4-4501-b4ee-37949a712d2a","year":2023},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:36.766601Z"},"links":{"cited_paper":"/paper/2303.02505","citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:f5a3d63b246a49b7c587053951d4816ab23126c13f1171c8e5c16d6242d0c883","observation_id":"3140bc79-3da6-4062-a460-0eed0ea391bd","resolution":{"observed_at":"2026-08-07T00:15:37.082762Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-08T06:32:00.761636+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T00:15:34.564754Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-07T00:15:34.564754Z"},"links":{"citing_paper":"/paper/2506.15021"},"observation_digest":"sha256:2de5b882e4135fa8e570d32b3f574e7f00e42c3527c0180675ca3d7133aeddc7","observation_id":"070e8d7b-3340-42d0-bbe5-28824f83265f","resolution":{"observed_at":"2026-08-07T00:15:34.564754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.15021","last_updated":"2025-06-17T23:12:28Z","latest_version":1,"primary_category":"cs.LG","snapshot_observed_at":"2026-08-08T17:58:45.055043Z","submitted_at":"2025-06-17T23:12:28Z","title":"SFT-GO: Supervised Fine-Tuning with Group Optimization for Large Language Models"},"reference_resolution":{"displayed":43,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":1,"verified_fuzzy":21},"total_outbound_references":43},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 43 of 43 outbound references and 0 inbound Pith citation observations for arXiv:2506.15021."}