{"as_of":"2026-08-12T22:50:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9b13cd4c863036cc105e4cd412c02866b67e3a732947b6c88caf35ffdd8bca43","coverage":[{"denominator":38,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":38,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-11T11:25:14.799196Z","state":"measured"},{"denominator":38,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":38,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2412.15524/citation-record","integrity":"/paper/2412.15524/integrity","json":"/paper/2412.15524/citation-record.json","paper":"/paper/2412.15524"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-08-10T14:07:02.234322Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-11T11:25:14.703507Z","title":"Phi-3 technical report: A highly capable language model locally on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.703507Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:bbbb5948300c48365e8baaa55b2f7648fd1fbbcfecb803dbd12509f06e39eef5","observation_id":"7706cd94-1b05-435c-b286-190ff7bc001b","resolution":{"observed_at":"2026-08-11T11:25:14.703507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-07T07:30:12.213965Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-11T11:25:14.706680Z","title":"Gpt-4 technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.706680Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:6f0ce01454b3e777efff6b8bcd19350e63c5b2a5c86bd5823a60ea3fb7e3c135","observation_id":"c881e4d1-d6f0-4a63-85f5-1a841c3a9640","resolution":{"observed_at":"2026-08-11T11:25:14.706680Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.16609","last_updated":"2023-09-28T17:07:49Z","snapshot_observed_at":"2026-08-09T21:25:20.369782Z","submitted_at":"2023-09-28T17:07:49Z","title":"Qwen Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.16609","snapshot_observed_at":"2026-08-11T11:25:14.709402Z","title":"Qwen technical report","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.709402Z"},"links":{"cited_paper":"/paper/2309.16609","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:1d662ea4437cefe20c8b2cad18314d410044c5c3fc13344756352d114b2da314","observation_id":"bf12983d-0afe-48b6-aa6b-e7c7a769ba9d","resolution":{"observed_at":"2026-08-11T11:25:14.709402Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.712008Z","title":"Meteor: An automatic metric for mt evaluation with improved correlation with human judgments","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.712008Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:27cc6e3f24380d66dff2ca65862e9bd54a4a38b68487fec12d0a2fa857c43c06","observation_id":"031d8da6-90bb-47b1-bb8a-c01afa940d30","resolution":{"observed_at":"2026-08-11T11:25:14.712008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.714266Z","title":"Pythia: A suite for analyzing large language models across training and scaling","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.714266Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:2e97fbebe3872828d0a7a1c8e7b8d2356306e12fc9144782f790f008dd2b7a2f","observation_id":"cad45276-edd1-49ee-8e1e-b7ba18e741a8","resolution":{"observed_at":"2026-08-11T11:25:14.714266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2005.14165","last_updated":"2020-07-22T19:47:17Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-05-28T17:29:03Z","title":"Language Models are Few-Shot Learners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2005.14165","snapshot_observed_at":"2026-08-11T11:25:14.716475Z","title":"Language models are few-shot learners","venue":null,"work_id":null,"year":2005},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.716475Z"},"links":{"cited_paper":"/paper/2005.14165","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:05082913a1ac6c5e1bdb062b35e526d0f8033a3dbecad217898e5b98ee6eb5b7","observation_id":"a7184216-70a3-482c-84be-7c9953d09c0e","resolution":{"observed_at":"2026-08-11T11:25:14.716475Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.719144Z","title":"Gonzalez, Ion Stoica, and Eric P","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.719144Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:d0506078964954357cdcec0bbedd41aeca4f7183295d7bf7e8a419f41d7106e1","observation_id":"ad41664b-7b22-43df-8473-1e4923bf080f","resolution":{"observed_at":"2026-08-11T11:25:14.719144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.721166Z","title":"Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.721166Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:bd399e9628e5ed59c75496850c7d7416159ab4a94def53883b5ea367bedb08c8","observation_id":"f0bc3b7b-27ee-4374-8938-66702cf5f376","resolution":{"observed_at":"2026-08-11T11:25:14.721166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:15.170634Z","title":"Free dolly: Introducing the world’s first truly open instruction-tuned llm","venue":null,"work_id":"74259144-3cd4-4825-94c6-4fecc5c139dd","year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.723180Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:319c15b9ebf5a235758f6cef4791d75bcbce06f3f5d84989aa5dbd4a6098541e","observation_id":"bab4b4d1-647b-4872-b176-3c2fa75077ab","resolution":{"observed_at":"2026-08-11T11:25:15.173850Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.21783","last_updated":"2024-11-23T23:27:33Z","snapshot_observed_at":"2026-08-10T16:40:37.411115Z","submitted_at":"2024-07-31T17:54:27Z","title":"The Llama 3 Herd of Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.21783","snapshot_observed_at":"2026-08-11T11:25:14.725327Z","title":"The llama 3 herd of models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.725327Z"},"links":{"cited_paper":"/paper/2407.21783","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:72d6354b7a66c7f962cd07a5ff30af76d1a1d3242959eab3c390c99e5b71bfc9","observation_id":"789a0590-c104-4f09-9d69-a9a27dc3041f","resolution":{"observed_at":"2026-08-11T11:25:14.725327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-11T11:25:14.729721Z","title":"Length-controlled alpacaeval: A simple way to debias automatic evaluators","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.729721Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:70d5d12cd00fd2bcef03fa083f2b7d4a841fe4269e7d678f1cd08d2f81c39222","observation_id":"dbb5bae7-83ed-47af-a34e-4ddb375f7903","resolution":{"observed_at":"2026-08-11T11:25:14.729721Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:15.163244Z","title":"Prolific first, 2014","venue":null,"work_id":"c78c6ed8-1524-443a-87fc-a2539f56cc14","year":2014},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.732761Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:52ae33692655b68278849c24eead54f2b2666e4926157286e756be8903bf8717","observation_id":"b40a680b-4166-4a2e-973b-ba933a162bf3","resolution":{"observed_at":"2026-08-11T11:25:15.166275Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.735127Z","title":"Koala: A dialogue model for academic research","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.735127Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:41f51e4040e04ee2659baf16ffd774830c8a1ec2c9b5dced4726bbf88a4e22ea","observation_id":"e8f6d6a5-2a32-4ffe-ab85-ad6c5c1dc123","resolution":{"observed_at":"2026-08-11T11:25:14.735127Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.00838","last_updated":"2024-06-07T21:59:52Z","snapshot_observed_at":"2026-07-06T17:23:51.547578Z","submitted_at":"2024-02-01T18:28:55Z","title":"OLMo: Accelerating the Science of Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.00838","snapshot_observed_at":"2026-08-11T11:25:14.737679Z","title":"Olmo: Accelerating the science of language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.737679Z"},"links":{"cited_paper":"/paper/2402.00838","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:04e869b48ea91403d779163877b775713d6e4eca608d4bdbd10df6fb0df8de78","observation_id":"c61b52af-9bf4-40e9-8c4f-45cac6a4323e","resolution":{"observed_at":"2026-08-11T11:25:14.737679Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-11T11:25:14.740531Z","title":"Mistral 7b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.740531Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:c6f8f46543f2b0a73a979e33f209db616d3fd01b6ba17777dcb5577a5606adfe","observation_id":"5acb2964-ccae-4b79-b572-bf6f503148cf","resolution":{"observed_at":"2026-08-11T11:25:14.740531Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.15124","last_updated":"2025-04-14T22:39:09Z","snapshot_observed_at":"2026-08-10T16:05:13.426341Z","submitted_at":"2024-11-22T18:44:04Z","title":"Tulu 3: Pushing Frontiers in Open Language Model Post-Training","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.15124","snapshot_observed_at":"2026-08-11T11:25:14.743211Z","title":"T \" ulu 3: Pushing frontiers in open language model post-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.743211Z"},"links":{"cited_paper":"/paper/2411.15124","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:93a8011d84da036e97135ab795ab66d2199d70bb5b39e544ba53d5b46afcc8d8","observation_id":"e7031387-07ef-4e83-8c48-a1284c4773d8","resolution":{"observed_at":"2026-08-11T11:25:14.743211Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11939","last_updated":"2024-10-14T18:11:58Z","snapshot_observed_at":"2026-08-11T09:34:38.920981Z","submitted_at":"2024-06-17T17:26:10Z","title":"From Crowdsourced Data to High-Quality Benchmarks: Arena-Hard and BenchBuilder Pipeline","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11939","snapshot_observed_at":"2026-08-11T11:25:14.745975Z","title":"From crowdsourced data to high-quality benchmarks: Arena-hard and benchbuilder pipeline","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.745975Z"},"links":{"cited_paper":"/paper/2406.11939","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:3fd0dbdacbbcc4c381e1192d8adc86647d278d62938725624720067d42c6b0a0","observation_id":"20da4237-8daa-47d7-b4a6-bda86fc023f9","resolution":{"observed_at":"2026-08-11T11:25:14.745975Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.748830Z","title":"Hashimoto","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.748830Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:bd185ec17c0611ece2c111091de709ec7f955163c6a0f43abb36c65efa33a5b7","observation_id":"572ca1ff-ee8c-4166-bf5b-4459465408c6","resolution":{"observed_at":"2026-08-11T11:25:14.748830Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.04770","last_updated":"2024-10-05T22:39:51Z","snapshot_observed_at":"2026-08-10T05:22:15.251139Z","submitted_at":"2024-06-07T09:15:44Z","title":"WildBench: Benchmarking LLMs with Challenging Tasks from Real Users in the Wild","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.04770","snapshot_observed_at":"2026-08-11T11:25:14.751441Z","title":"Wildbench: Benchmarking llms with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.751441Z"},"links":{"cited_paper":"/paper/2406.04770","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:4da470157e1415194ab54b40f3603e08de100cfedfd90ddce1a3bbc867d05a39","observation_id":"41f67fbc-9b0f-4496-9aed-7946f7789fc2","resolution":{"observed_at":"2026-08-11T11:25:14.751441Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.754255Z","title":"Rouge: A package for automatic evaluation of summaries","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.754255Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:e09fd40a2700074a119d1b0503f82036ecab52c15f90e5902450af030fd12709","observation_id":"ed911785-929d-4109-8c39-72eb30362baf","resolution":{"observed_at":"2026-08-11T11:25:14.754255Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1907.11692","last_updated":"2019-07-26T17:48:29Z","snapshot_observed_at":"2026-07-31T22:31:37.910868Z","submitted_at":"2019-07-26T17:48:29Z","title":"RoBERTa: A Robustly Optimized BERT Pretraining Approach","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1907.11692","snapshot_observed_at":"2026-08-11T11:25:14.756813Z","title":"Roberta: A robustly optimized BERT pretraining approach","venue":null,"work_id":null,"year":1907},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.756813Z"},"links":{"cited_paper":"/paper/1907.11692","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:911ec9250c9089adbb6c4c53f35e5f3f546df49b1c61488ca93dd4efed55ec3c","observation_id":"36f8f95d-5a6e-4b0a-9224-0cc542b41a37","resolution":{"observed_at":"2026-08-11T11:25:14.756813Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.19133","last_updated":"2025-05-30T23:40:44Z","snapshot_observed_at":"2026-08-12T22:15:33.450854Z","submitted_at":"2024-10-24T20:04:15Z","title":"Hybrid Preferences: Learning to Route Instances for Human vs. AI Feedback","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.19133","snapshot_observed_at":"2026-08-11T11:25:14.759366Z","title":"Hybrid preferences: Learning to route instances for human vs","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.759366Z"},"links":{"cited_paper":"/paper/2410.19133","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:aff65c7d430a8b719d7ca524c06bde2dcac8bf453ff81f24ac4401db89e3d6c5","observation_id":"e061115e-7682-4609-af9e-a0d808278e08","resolution":{"observed_at":"2026-08-11T11:25:14.759366Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.762244Z","title":"Training language models to follow instructions with human feedback","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.762244Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:31375ec183b122b9dedab26549aa4aee695d3265af1ade0bb5eaa8758933db67","observation_id":"992f0be7-0a2a-4244-b48a-5a6aa77b3024","resolution":{"observed_at":"2026-08-11T11:25:14.762244Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.764678Z","title":"Bleu: a method for automatic evaluation of machine translation","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.764678Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:f3e139280d66e040e8dec352c4740505331eb4355073877322e813870b4200d3","observation_id":"0a8d359b-4a7c-4894-b8c0-a6f3b0a20d75","resolution":{"observed_at":"2026-08-11T11:25:14.764678Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2304.03277","last_updated":"2023-04-06T17:58:09Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-04-06T17:58:09Z","title":"Instruction Tuning with GPT-4","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2304.03277","snapshot_observed_at":"2026-08-11T11:25:14.767175Z","title":"Instruction tuning with gpt-4","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.767175Z"},"links":{"cited_paper":"/paper/2304.03277","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:4002fb25a0ef2782f86b6c44b9d52a95233e912a87ee8e30a0739b92af2d7970","observation_id":"2cfb50f5-8bd9-4199-974f-3f991d7c63ec","resolution":{"observed_at":"2026-08-11T11:25:14.767175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:15.135738Z","title":"Rush, and Thomas Wolf","venue":null,"work_id":"d12c5750-8bd7-4394-95ca-eed432a45ebb","year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.769774Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:3673ad470679ce93baa0ee4fb356223489d475286dbda67206ce4b0052069f75","observation_id":"338f78d9-b7f2-4e35-b073-b1b18bbb01da","resolution":{"observed_at":"2026-08-11T11:25:15.139419Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-12T06:34:41.77262+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2307.09288","last_updated":"2023-07-19T17:08:59Z","snapshot_observed_at":"2026-08-07T12:56:43.323460Z","submitted_at":"2023-07-18T14:31:57Z","title":"Llama 2: Open Foundation and Fine-Tuned Chat Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.09288","snapshot_observed_at":"2026-08-11T11:25:14.773071Z","title":"Llama 2: Open foundation and fine-tuned chat models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.773071Z"},"links":{"cited_paper":"/paper/2307.09288","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:589b1c985123b03ed04b932442556f38abe640720219872abca4dcf8ff393f22","observation_id":"dd800184-77d9-4d0a-ae27-631d3eb0e644","resolution":{"observed_at":"2026-08-11T11:25:14.773071Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2212.10560","last_updated":"2023-05-25T23:50:07Z","snapshot_observed_at":"2026-07-06T14:33:11.945106Z","submitted_at":"2022-12-20T18:59:19Z","title":"Self-Instruct: Aligning Language Models with Self-Generated Instructions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2212.10560","snapshot_observed_at":"2026-08-11T11:25:14.775460Z","title":"Self-instruct: Aligning language models with self-generated instructions","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.775460Z"},"links":{"cited_paper":"/paper/2212.10560","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:9c54444064a0c86e7972a0dd188de253a284487fc5b7dc4ad6b056eec9f804b2","observation_id":"5cae3dbb-297c-4350-bb5e-e42e7a5e23d8","resolution":{"observed_at":"2026-08-11T11:25:14.775460Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.777734Z","title":"Wizard LM : Empowering large pre-trained language models to follow complex instructions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.777734Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:9b43f80a6ad2e4be4725ca947e2b69397d803a746056437caa6a4697e335d1b6","observation_id":"23fba9b4-7939-44c8-ac85-a20c49a25d39","resolution":{"observed_at":"2026-08-11T11:25:14.777734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04652","last_updated":"2025-01-21T10:12:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-07T16:52:49Z","title":"Yi: Open Foundation Models by 01.AI","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.04652","snapshot_observed_at":"2026-08-11T11:25:14.780280Z","title":"Yi: Open foundation models by 01","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.780280Z"},"links":{"cited_paper":"/paper/2403.04652","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:c5391baf727497a6037fa1aa6811b025c18a226a9d6db859bf9663da7a2bc2e8","observation_id":"3f726c6b-5af5-4628-8a61-c223d586a93e","resolution":{"observed_at":"2026-08-11T11:25:14.780280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1904.09675","last_updated":"2020-02-24T18:59:28Z","snapshot_observed_at":"2026-07-29T15:42:51.774083Z","submitted_at":"2019-04-21T23:08:53Z","title":"BERTScore: Evaluating Text Generation with BERT","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1904.09675","snapshot_observed_at":"2026-08-11T11:25:14.782701Z","title":"Bertscore: Evaluating text generation with bert","venue":null,"work_id":null,"year":1904},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.782701Z"},"links":{"cited_paper":"/paper/1904.09675","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:2cc374b7340dd24aa85bfeb0b9e3c12bb23c51aa06ddb416d989b1e15af141f9","observation_id":"78d5f30d-0b37-4831-8052-de1308fed6ba","resolution":{"observed_at":"2026-08-11T11:25:14.782701Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01470","last_updated":"2024-05-02T17:00:02Z","snapshot_observed_at":"2026-07-06T18:08:56.480769Z","submitted_at":"2024-05-02T17:00:02Z","title":"WildChat: 1M ChatGPT Interaction Logs in the Wild","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01470","snapshot_observed_at":"2026-08-11T11:25:14.785234Z","title":"Wildchat: 1m chatgpt interaction logs in the wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.785234Z"},"links":{"cited_paper":"/paper/2405.01470","citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:3c7c42a737e9a8578ef62ddff835b6c2ff1b1c7e87c50ab6c6a08379c36a57f7","observation_id":"f7bbac03-8951-477a-8718-8faaf4e2e05d","resolution":{"observed_at":"2026-08-11T11:25:14.785234Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.787566Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.787566Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:fb49b645cd4ab9c66fccd8cbbddf843605f81b7e3df294872b144cf42a256a8f","observation_id":"191909aa-9571-4ddf-a930-03927830be7e","resolution":{"observed_at":"2026-08-11T11:25:14.787566Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.789520Z","title":"Lima: Less is more for alignment","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.789520Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:82e674709e0f8d761f9b95fcb2ecc328e4ce96d29ca40f68915ae639b1c00858","observation_id":"6f5bd239-60f3-4dc1-a9f7-fec408cad0e7","resolution":{"observed_at":"2026-08-11T11:25:14.789520Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.791614Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.791614Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:ef3a910dcd71a94d61c396b79cede0f88a9a1f36e7137231a93ddf3e62537b56","observation_id":"8705ba5c-2c97-44c5-8f55-c37a6eab485f","resolution":{"observed_at":"2026-08-11T11:25:14.791614Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.794326Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":36,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.794326Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:4d476208ea12d42b1241a6d944b28a8bb19237dadb8d7ffdba1b7e4a887502d4","observation_id":"6d59554a-79f9-4417-9fc0-d1133d89f1b1","resolution":{"observed_at":"2026-08-11T11:25:14.794326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.796665Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":37,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.796665Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:6e428b42077da1a8083e425b87b97eecf5ee0358fa07c299f505161174472d1a","observation_id":"776f9b1b-3835-48ef-b18d-8f9d18609a68","resolution":{"observed_at":"2026-08-11T11:25:14.796665Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-11T11:25:14.799196Z","title":"Hide and Seek","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models","version":2},"reference_index":38,"source":"arxiv_source","source_observed_at":"2026-08-11T11:25:14.799196Z"},"links":{"citing_paper":"/paper/2412.15524"},"observation_digest":"sha256:af7547a862ff405646f28589ec0a18456a8a9984e2d5cb0a344fc1f7b8d4aada","observation_id":"e33ad84e-b466-403e-b816-10e04b97dc4a","resolution":{"observed_at":"2026-08-11T11:25:14.799196Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2412.15524","last_updated":"2025-03-24T19:31:44Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-11T19:12:07.398406Z","submitted_at":"2024-12-20T03:26:47Z","title":"HREF: Human Response-Guided Evaluation of Instruction Following in Language Models"},"reference_resolution":{"displayed":38,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":34,"verified_exact":0,"verified_fuzzy":3},"total_outbound_references":38},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 38 of 38 outbound references and 0 inbound Pith citation observations for arXiv:2412.15524."}