{"as_of":"2026-08-08T22:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a60ad531528c2a2bd31dc75ac3d3c288f27ea99b24710b3875cbe14bb281b908","coverage":[{"denominator":45,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":45,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T21:20:29.888987Z","state":"measured"},{"denominator":45,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":45,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-08T06:32:00.761636+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.16122/citation-record","integrity":"/paper/2607.16122/integrity","json":"/paper/2607.16122/citation-record.json","paper":"/paper/2607.16122"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.052530Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.052530Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:00ce09c46eafc84c3e1f04ecdd02fec12526a5d1d3750e83fad4cd9e7b7032be","observation_id":"eeaafd01-b6d5-4b49-8ec3-95f5709c72f3","resolution":{"observed_at":"2026-08-01T21:20:25.052530Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.08775","last_updated":"2025-05-13T17:53:59Z","snapshot_observed_at":"2026-07-06T21:23:23.760393Z","submitted_at":"2025-05-13T17:53:59Z","title":"HealthBench: Evaluating Large Language Models Towards Improved Human Health","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.08775","snapshot_observed_at":"2026-08-01T21:20:25.119254Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.119254Z"},"links":{"cited_paper":"/paper/2505.08775","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:92ae883ee9b1f236f3b627a5ba54ad9398a4003d6041c2236be81ac7d62dcf3f","observation_id":"eed199f4-f09b-4a45-8de0-21fb09b2ccfc","resolution":{"observed_at":"2026-08-01T21:20:25.119254Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.196490Z","title":"Chen, Y.-M","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.196490Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:9590f1abff14fee6f9918d5e22ab70205d4d571ae4c63c5a44de4bd99b07fa56","observation_id":"40aa89b9-cbb8-4809-bbe1-5eb40271648f","resolution":{"observed_at":"2026-08-01T21:20:25.196490Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.267860Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.267860Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:256328ebfaae580a709d42ecfb6ae3327b15fceb950b9704358a8880ef1de83b","observation_id":"61eb5214-4c6c-46bf-865c-77e0460f76e2","resolution":{"observed_at":"2026-08-01T21:20:25.267860Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.333464Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.333464Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:555becc533ccda11cfb5a60b4eb1e8bfc45683f94d24f12f04d2cb5566197fba","observation_id":"2afc72e5-0d8c-4d50-b5bd-fc132986bff7","resolution":{"observed_at":"2026-08-01T21:20:25.333464Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-08-01T21:20:25.396821Z","title":"Comanici, E","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.396821Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:35baf64923003dc974b237d7acd18ba427e6ac7d0d9b2ce3082ed1eab3606f68","observation_id":"a34144c5-2c9f-4d94-96ad-80d1763c41c8","resolution":{"observed_at":"2026-08-01T21:20:25.396821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.401732Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.401732Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:18f2dafa943262fb57f4c294ab0bfaacfd000fd031e83e3423a94c8055510218","observation_id":"5a820982-a194-4aa2-ab4d-b878d1d129f2","resolution":{"observed_at":"2026-08-01T21:20:25.401732Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.04945","last_updated":"2025-04-07T11:31:22Z","snapshot_observed_at":"2026-08-07T16:08:01.274380Z","submitted_at":"2025-04-07T11:31:22Z","title":"A Llama walks into the 'Bar': Efficient Supervised Fine-Tuning for Legal Reasoning in the Multi-state Bar Exam","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.04945","snapshot_observed_at":"2026-08-01T21:20:25.428186Z","title":"Fernandes, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.428186Z"},"links":{"cited_paper":"/paper/2504.04945","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:339ae8c1b6727c7f01b1c52f185072b71ad49b6de823124a2413ab9ca42cb1df","observation_id":"b71bc2f3-9761-4111-b498-3b6d2e53c3f0","resolution":{"observed_at":"2026-08-01T21:20:25.428186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-07-06T18:55:11.576666Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-01T21:20:25.562711Z","title":"Grattafiori, A","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.562711Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:ed815601d71173548c2d5d218d3d82a98b90ab92b8e3976f4e6ac7fc84131693","observation_id":"4a4ea224-9747-48ce-821d-0b235c77735d","resolution":{"observed_at":"2026-08-01T21:20:25.562711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:25.664394Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.664394Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a548b13828077f7f71e4e6400a66de9abf0baf95a02c2433dc510f590b8d7a85","observation_id":"48a93664-a043-4401-ab41-1a59452092af","resolution":{"observed_at":"2026-08-01T21:20:25.664394Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.17746","last_updated":"2025-10-03T01:55:55Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-23T17:57:55Z","title":"Rubrics as Rewards: Reinforcement Learning Beyond Verifiable Domains","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.17746","snapshot_observed_at":"2026-08-01T21:20:25.802827Z","title":"Gunjal, A","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:25.802827Z"},"links":{"cited_paper":"/paper/2507.17746","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:fbb96a956787352d948e84b5b2902084e9fa0f1d444568f27ecdc97688a918f0","observation_id":"2d35437a-b517-422f-b63b-23d67285a79e","resolution":{"observed_at":"2026-08-01T21:20:25.802827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.062140Z","title":"Hendrycks, C","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.062140Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:9b0ba57b29fe4964fe4a83044c6923340c4a52b16fd94c1542091484d829cbb1","observation_id":"3587a60d-7312-4fab-b4e1-8ff2bf7e1584","resolution":{"observed_at":"2026-08-01T21:20:26.062140Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.314765Z","title":"Holzenberger, A","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.314765Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d5c0ac065d9a06015b366d43fcf162875666165d8d185281d9e5aae60a871c9f","observation_id":"7bb55530-7e39-445e-92ef-c8e2f36f37f3","resolution":{"observed_at":"2026-08-01T21:20:26.314765Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.195798Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.195798Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:e86675a3e95424c10c138f36e55b99d65e465d919216a3c6faac667cb6416103","observation_id":"6a359814-8b44-40fa-af33-8e599bf1e5a2","resolution":{"observed_at":"2026-08-01T21:20:26.195798Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-01T21:20:26.494751Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.494751Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:cf3a0b04706c52542ae41ade318cbb05c888e07a700cee99eae9052fe0985b59","observation_id":"9db14fd9-c1e3-4899-87c6-d5dc8686203f","resolution":{"observed_at":"2026-08-01T21:20:26.494751Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.392634Z","title":"Islam, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.392634Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:52c67f11de35831ad55b3d1e38b5fe876e2f9895277614972d3aa60afba8a36c","observation_id":"8818786e-511a-4ed8-95da-ae1a44bc8cb4","resolution":{"observed_at":"2026-08-01T21:20:26.392634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.727937Z","title":null,"venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.727937Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:c184e405e5d373d2e9869e5ef7b0a0bd0012ae026203fc08e96df849aedfdb85","observation_id":"090bf821-e32f-4853-b812-dd741b1de6a5","resolution":{"observed_at":"2026-08-01T21:20:26.727937Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.604759Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.604759Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a22ce8ae93d2adeed97afa59a294b80fd09dffed5a9e0e0090ece243503ebdfa","observation_id":"ca511cdb-a9b1-4462-9c87-b169a4e16778","resolution":{"observed_at":"2026-08-01T21:20:26.604759Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.026968Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.026968Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:90409c1df8a651b2a7e2d0c1f2472500a9e9bd4e213fe708cdb74849f303fc19","observation_id":"34c2a0a1-d160-4f96-95da-73137bf14510","resolution":{"observed_at":"2026-08-01T21:20:27.026968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.825972Z","title":"Koreeda and C","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.825972Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:91526c37ed38baf3767dcd2a41dc80752fe44782cbf685ab04d700d9f083d45b","observation_id":"c948e65b-be5b-4c02-b8f0-728faa2a9548","resolution":{"observed_at":"2026-08-01T21:20:26.825972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:26.905563Z","title":"doi: 10.18653/v1/2021.findings-emnlp.164","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:26.905563Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:155e0e14e74c44d87d81677da18debdf2bce1c97507ff93033bb535a83d09f38","observation_id":"58473149-d5a4-4b34-8a6a-b71f8165db69","resolution":{"observed_at":"2026-08-01T21:20:26.905563Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12474","last_updated":"2026-05-12T17:54:25Z","snapshot_observed_at":"2026-08-03T08:00:52.890954Z","submitted_at":"2026-05-12T17:54:25Z","title":"Reward Hacking in Rubric-Based Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2605.12474","snapshot_observed_at":"2026-08-01T21:20:27.402253Z","title":"Mahmoud, M","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.402253Z"},"links":{"cited_paper":"/paper/2605.12474","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:bfdbaee657de193d550e8f9cba1b2a028ac9a57a0f0208fab46ba626e678e269","observation_id":"84f5df99-0376-44ec-875a-8bc0944af66e","resolution":{"observed_at":"2026-08-01T21:20:27.402253Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.147438Z","title":"Liang, R","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.147438Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:a8eefd7d34dce9dc93e01c10f03399306fd5c5441df4723b60183e9857d77c2f","observation_id":"ca2f5c48-46ee-4c24-a23d-96cb0662fade","resolution":{"observed_at":"2026-08-01T21:20:27.147438Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.243513Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.243513Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:e1141f115875b94d8991bd3f732df405b07fbfee646dd46254ae3b80ec963866","observation_id":"1b121e1d-0498-4214-a49e-20ac5e497060","resolution":{"observed_at":"2026-08-01T21:20:27.243513Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.647467Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.647467Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:5b044dba698ff5544de8b6556591644eb2b27c828b7d1462e154704b1df1d107","observation_id":"27025dbf-4308-4170-81db-0f7f4b548a4f","resolution":{"observed_at":"2026-08-01T21:20:27.647467Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.876935Z","title":"Rezaei, R","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.876935Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:7981f6bf297b5097a0b37e2fa4adfe06ce3aba601e13a11dbe19ef9164609b8a","observation_id":"b80988d9-40ed-4407-ab43-ee31576548d9","resolution":{"observed_at":"2026-08-01T21:20:27.876935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.464754Z","title":null,"venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.464754Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:401eaa08ebecb58f8ad80de82dd8bd31f5d06744fe433f8e256d07f1ec7c81ef","observation_id":"5eb7f174-fec1-4ca5-99d0-d36c09ec91f4","resolution":{"observed_at":"2026-08-01T21:20:27.464754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.552725Z","title":"text-embedding-3-small","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.552725Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:e7fe70ffd8f769c0557f889391c0d4b0c02fb1a541ef8a489cb9fabc09037e2c","observation_id":"81ded3b6-25e7-4662-a9d7-7a65e7ae28b2","resolution":{"observed_at":"2026-08-01T21:20:27.552725Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.143621Z","title":"Srivastava, A","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.143621Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:6ec85a04b5423890a381cb285bfe60668a862ecdae0a18389918a46aa385f787","observation_id":"c62708b8-836c-446d-855e-acfa4b610128","resolution":{"observed_at":"2026-08-01T21:20:28.143621Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.13678","last_updated":"2024-12-18T10:05:43Z","snapshot_observed_at":"2026-08-08T02:37:51.971374Z","submitted_at":"2024-12-18T10:05:43Z","title":"Clio: Privacy-Preserving Insights into Real-World AI Use","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.13678","snapshot_observed_at":"2026-08-01T21:20:28.224786Z","title":"Tamkin, M","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.224786Z"},"links":{"cited_paper":"/paper/2412.13678","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:91f191d77a97a263dc5d74f601a44e1f20ca9e87ad1cc61d1f85d388b00972b7","observation_id":"c72657d9-80a2-48a7-87e5-747387d8ea52","resolution":{"observed_at":"2026-08-01T21:20:28.224786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.338541Z","title":"Viswanathan, Y","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.338541Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:af5fb6b87612c7e5d541b6ee13e3328d7c904ac27a1ce22c3a18136d34d68a68","observation_id":"caed2041-e90a-4d34-9421-5c670e72ce89","resolution":{"observed_at":"2026-08-01T21:20:28.338541Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.962571Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.962571Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:68d01d65bab2b2f51da47c6b0a162db1c64bf6f48e179bd4d90e1a9ca71652e9","observation_id":"c5f3fa74-8215-4349-8244-bf0b5f3e5811","resolution":{"observed_at":"2026-08-01T21:20:27.962571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.071115Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.071115Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d2450d6aa6b7eaec0a002ae3bdc0b54db9bc0e80a1fe05f132f5115b12984c1c","observation_id":"55539be8-4d65-4147-9f97-0e3ccb9f4372","resolution":{"observed_at":"2026-08-01T21:20:28.071115Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-08-01T21:20:28.852288Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.852288Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:e04bf40055ee1890bc5d2394cae173eab0c9f34bae2f60f0898f7d2109cdefd8","observation_id":"d69c5ac4-3481-4262-85fd-74251d099c87","resolution":{"observed_at":"2026-08-01T21:20:28.852288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.015248Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.015248Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:26946bcc88618898e703e0750ca5c1e57000250b2eab2c2c75eaf53f14be7cf8","observation_id":"e754a5b8-829d-4da5-b873-0117f110f480","resolution":{"observed_at":"2026-08-01T21:20:29.015248Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.123126Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.123126Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:1a85dcd6d44e4dd4ca7257bd85d4d368f8efc6c7ff0474a269c810928b9b945e","observation_id":"99fd1b76-a5ae-4e44-8a79-b848f5e62b43","resolution":{"observed_at":"2026-08-01T21:20:29.123126Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.550321Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.550321Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d1236016d78065d2db53bceb05018f1108518d6262bfbf720ca6ff2e691442f1","observation_id":"89b5912d-f953-4fbb-8bea-0939b24c5eac","resolution":{"observed_at":"2026-08-01T21:20:28.550321Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:28.690135Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:28.690135Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:d813fa3e19caa38901ce6b8bff32cbbf770f9fdd1cf030518e0904d4efd51a7a","observation_id":"9e7cb0b3-109e-45d8-858c-d02a5a089925","resolution":{"observed_at":"2026-08-01T21:20:28.690135Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.652546Z","title":null,"venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.652546Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:58b0ecf9e831fa3b59b1b427e90ead1961cb72d6a690563d1dce530ce0d65aa5","observation_id":"1932aacf-d6e6-4dac-8e27-3fc47ae0a690","resolution":{"observed_at":"2026-08-01T21:20:29.652546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.766316Z","title":"Zheng, N","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.766316Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:f3611ce5ddfb571f2bf4865fd49b38ae9433cb2a6b6aaa41a2bd09260b542573","observation_id":"562dde5f-5b65-42cd-a41d-beea6cfef163","resolution":{"observed_at":"2026-08-01T21:20:29.766316Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.888987Z","title":null,"venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.888987Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:416668c6bad3ae19a2ec031f49cf9a36f99ad803ca79e9cd59ef3447d443e53d","observation_id":"31f7c4a8-87fe-44ae-946e-00d26018c848","resolution":{"observed_at":"2026-08-01T21:20:29.888987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.325864Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.325864Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:8d9b39af05a6df6e48b95f7d3372c1e6ce52bc3285842c98501e5d1d2e60620b","observation_id":"d6c52398-f9df-42b3-bb89-3e238d07da79","resolution":{"observed_at":"2026-08-01T21:20:29.325864Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:29.456855Z","title":"Zhang, Z","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:29.456855Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:95d2991e18678261aae36c065c781c9d52d35226b0b8c3eb9d7669e321772650","observation_id":"1be8a02b-0dcb-407e-b69a-3b2bd7c7f835","resolution":{"observed_at":"2026-08-01T21:20:29.456855Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.315555Z","title":"doi: 10.18653/v1/2023.emnlp-main.153","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.315555Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:aba049ae8267f9d9a4c57de6fc8aa0281def3500f20fa2eb9f9cbf45b99007e7","observation_id":"bb378d81-5398-49f5-8d62-89538eadc7e0","resolution":{"observed_at":"2026-08-01T21:20:27.315555Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T21:20:27.751974Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-01T21:20:27.751974Z"},"links":{"citing_paper":"/paper/2607.16122"},"observation_digest":"sha256:2b4fc874dddf372f6cfe324d7cb3778d839296469ca5256250b8f50421ba24c1","observation_id":"c66014a0-0125-40be-9749-fc12a664ae87","resolution":{"observed_at":"2026-08-01T21:20:27.751974Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.16122","last_updated":"2026-07-17T17:00:38Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-06T22:43:39.498196Z","submitted_at":"2026-07-17T17:00:38Z","title":"CRAFT: Clustering Rubrics to Diagnose Weak LLM Capabilities and Generate Targeted Fine-Tuning Data"},"reference_resolution":{"displayed":45,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":45,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":45},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-08T06:32:00.761636+00:00","source":"crossref"},{"observed_at":"2026-08-08T06:31:55.24221+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 45 of 45 outbound references and 0 inbound Pith citation observations for arXiv:2607.16122."}