{"as_of":"2026-08-17T20:13:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:9f4284be01c383857ab18665c0f878610d950d4a720c569569cc313c82a37e9f","coverage":[{"denominator":35,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":35,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:34:42.445714Z","state":"measured"},{"denominator":37,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":37,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-17T06:30:58.91139+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T13:28:02.231013Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"pith","source_observed_at":"2026-08-07T13:28:02.879377Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"cited_work":{"arxiv_id":"2504.15219","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.15219","snapshot_observed_at":"2026-08-07T13:28:02.879377Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","venue":"cs.CL","work_id":"fab3a5d1-8465-4f13-980e-96712f60497f","year":2025},"citing_paper":{"arxiv_id":"2505.21757","last_updated":"2025-05-27T20:48:04Z","snapshot_observed_at":"2026-08-12T11:00:49.218466Z","submitted_at":"2025-05-27T20:48:04Z","title":"BehaviorSFT: Behavioral Token Conditioning for Clinical Agents Across the Proactivity Spectrum","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T13:28:02.231013Z"},"links":{"cited_paper":"/paper/2504.15219","citing_paper":"/paper/2505.21757"},"observation_digest":"sha256:b137745175930b5654c582903da6c588e16dedf29ad756122e6050098546c6fd","observation_id":"dece3487-360c-4aff-851e-49ebc34f9eb9","resolution":{"observed_at":"2026-08-07T13:28:02.922311Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.15219","snapshot_observed_at":"2026-08-02T06:35:59.589082Z","title":"differentiation","venue":null,"work_id":null,"year":1950},"citing_paper":{"arxiv_id":"2607.13104","last_updated":"2026-07-14T09:12:57Z","snapshot_observed_at":"2026-08-16T19:24:00.602742Z","submitted_at":"2026-07-14T09:12:57Z","title":"Self-Improvements in Modern Agentic Systems: A Survey","version":1},"reference_index":1948,"source":"pdf_text","source_observed_at":"2026-08-02T06:35:59.589082Z"},"links":{"cited_paper":"/paper/2504.15219","citing_paper":"/paper/2607.13104"},"observation_digest":"sha256:ed6cc39090004c005ba12b13a84f61d592709fbc1d6987dcb7c107dd1aa8cad3","observation_id":"ce7d7a5e-20c1-46ec-be8d-f92522bbf4ee","resolution":{"observed_at":"2026-08-02T06:35:59.589082Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2504.15219/citation-record","integrity":"/paper/2504.15219/integrity","json":"/paper/2504.15219/citation-record.json","paper":"/paper/2504.15219"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.407178Z","title":"Art or Artifice? Large Language Models and the False Promise of Creativity","venue":null,"work_id":"860f8ff2-ca34-4100-8fc8-1d4c50e45fb1","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":1,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.210971Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:14e2df8d2cfd83f7c6a2bfe35de5899000f6af2f9fc385790c7a99ea0dd89d49","observation_id":"dc80ca97-e0d2-4389-88bf-08dd822a47f8","resolution":{"observed_at":"2026-08-16T11:34:43.413201Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.14509","last_updated":"2025-03-04T18:55:27Z","snapshot_observed_at":"2026-08-16T13:16:29.001314Z","submitted_at":"2024-09-22T16:13:00Z","title":"Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.14509","snapshot_observed_at":"2026-08-16T11:34:42.222740Z","title":"Can AI writing be salvaged? Mitigating Idiosyncrasies and Improving Human-AI Alignment in the Writing Process through Edits","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":2,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.222740Z"},"links":{"cited_paper":"/paper/2409.14509","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:a05c2a3a4fd2504cad9e4c274380c7eb71016aa3297b6504df347fe1960864fe","observation_id":"8bf1413d-b26a-4b87-867f-348f66932095","resolution":{"observed_at":"2026-08-16T11:34:42.222740Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.230404Z","title":"Complex Claim Verification with Evidence Retrieved in the Wild","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":3,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.230404Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:1333c2bc440a6c3a6ac3dac77db4590b3dc8c48ad43c432296227dff4235a56e","observation_id":"69546b1e-1f75-4132-827f-40495f4dd5a5","resolution":{"observed_at":"2026-08-16T11:34:42.230404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.383520Z","title":"Angelopoulos, Tianle Li, Dacheng Li, Banghua Zhu, Hao Zhang, Michael I","venue":null,"work_id":"93214d2a-c3fb-4a96-b972-2c2a0c188767","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":4,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.244411Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:92228401b72ab9278365f8dfcb36deb9eb7887478b13f6935898062261e4248b","observation_id":"1d06759a-6ef0-478d-a0c1-1fdeb0a93276","resolution":{"observed_at":"2026-08-16T11:34:43.390375Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2410.03608","last_updated":"2024-10-04T17:09:08Z","snapshot_observed_at":"2026-08-16T13:12:30.644500Z","submitted_at":"2024-10-04T17:09:08Z","title":"TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.03608","snapshot_observed_at":"2026-08-16T11:34:42.252534Z","title":"TICKing All the Boxes: Generated Checklists Improve LLM Evaluation and Generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":5,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.252534Z"},"links":{"cited_paper":"/paper/2410.03608","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:0daca6900778012ee28814de97e758cf90ac66b4719c59870261b79f00121c32","observation_id":"3985c6c8-bb01-497a-b7bf-2406a0c5be53","resolution":{"observed_at":"2026-08-16T11:34:42.252534Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.366715Z","title":"Gonzalez","venue":null,"work_id":"bb438bd5-552c-4b6e-9d7c-9ccb39c8a6cb","year":2025},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":6,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.263813Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:f4d33c195fae1451f730721d5195b91a692ca6e9a07cebef659edb42454108d5","observation_id":"c962e89d-71ce-44e6-829c-f7db689d7c1b","resolution":{"observed_at":"2026-08-16T11:34:43.371846Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05761","last_updated":"2025-03-25T07:12:10Z","snapshot_observed_at":"2026-08-16T13:44:47.609069Z","submitted_at":"2024-06-09T12:30:30Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05761","snapshot_observed_at":"2026-08-16T11:34:42.280569Z","title":"The BiGGen Bench: A Principled Benchmark for Fine-grained Evaluation of Language Models with Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":7,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.280569Z"},"links":{"cited_paper":"/paper/2406.05761","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:ca2908dabdae470f30bf1257c161e517d3debe014a276c4798e67dc38954beef","observation_id":"52971542-9699-47ac-9a56-320483853afa","resolution":{"observed_at":"2026-08-16T11:34:42.280569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.286451Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":8,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.286451Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:8d786427b034e673a789e30b27020a1cd1bf59b0935be73f22c491ec1e15ae7a","observation_id":"adba927f-252c-4890-b8ab-a746d39eef5b","resolution":{"observed_at":"2026-08-16T11:34:42.286451Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.298607Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":9,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.298607Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:dc3d0e76928a28c9cf24197a6af08cb30840597e4fa8a82f35d9719de92fd526","observation_id":"4c348ca0-2464-4ca0-913a-9373a1a9281b","resolution":{"observed_at":"2026-08-16T11:34:42.298607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.308377Z","title":"Linguistically-Informed Specificity and Semantic Plausibility for Dialogue Generation","venue":null,"work_id":"4cd9e675-9a58-4a3c-814e-a0b304f620f9","year":2019},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":10,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.304270Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:719222768a94a1db054583d5f7ec84a7ff21e417e618d9f01358c7280ffc88b5","observation_id":"99eacea3-4d3c-4d4c-8e35-5aac3f5fdfda","resolution":{"observed_at":"2026-08-16T11:34:43.316933Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.285657Z","title":"Large Language Models Are State-of-the-Art Evaluators of Translation Quality","venue":null,"work_id":"3d23f032-491d-45d4-8ccf-3a045b4dfd58","year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.309014Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:1e94a5544c0cd273ee3de0775596defa28327cc3580945932212645787778cf7","observation_id":"12ccbb68-75cb-41a7-afaf-d1e0d590d972","resolution":{"observed_at":"2026-08-16T11:34:43.291782Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.257137Z","title":"Hashimoto","venue":null,"work_id":"e8545da2-5bf3-4913-867b-d9f80d7a8395","year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":12,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.315778Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:c28d65343a955bce9f0d4af9e82fb8c2a9d709d15563a2872846aaff74572e69","observation_id":"7342278c-4d72-44ab-8575-f2f90ce1aacc","resolution":{"observed_at":"2026-08-16T11:34:43.263699Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.325583Z","title":"Wildbench: Benchmarking LLM s with challenging tasks from real users in the wild","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":13,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.325583Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:b2f7f0a77c94b4329bf0a65236d81aeddf18f0419aeb6c793d74ccde244de0dc","observation_id":"90a8c738-2023-4469-90ea-8bf2bb399a19","resolution":{"observed_at":"2026-08-16T11:34:42.325583Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.175229Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","venue":null,"work_id":"86ebac6a-edd8-4679-829d-4836189565f4","year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":14,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.337084Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:db01b6c3e23f1b2f434bd60f701cdf1d7c5aa68550e516535d6d395af2c2a01a","observation_id":"a2b6920b-4535-4644-b467-0f4012614289","resolution":{"observed_at":"2026-08-16T11:34:43.181610Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.341801Z","title":"ExpertQA: Expert-Curated Questions and Attributed Answers","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":15,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.341801Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:c7f66fb2cd9f4efdebb43448332809ef566c4c30a2ed153525377c62a15da15a","observation_id":"5d9e88f1-b382-4fac-ba89-99bf33df1689","resolution":{"observed_at":"2026-08-16T11:34:42.341801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.347058Z","title":"Dolomites: Domain-Specific Long-Form Methodical Tasks","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":16,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.347058Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:28f4c86b502f69fda8e7133452bededd15f41ac2da1419db8158b99905b53e83","observation_id":"70159c1a-3ed7-4fe4-b530-5500477f9a25","resolution":{"observed_at":"2026-08-16T11:34:42.347058Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07237","last_updated":"2025-05-23T18:32:07Z","snapshot_observed_at":"2026-08-16T13:01:03.342994Z","submitted_at":"2024-11-11T18:58:38Z","title":"Contextualized Evaluations: Judging Language Model Responses to Underspecified Queries","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.07237","snapshot_observed_at":"2026-08-16T11:34:42.353884Z","title":"Contextualized Evaluations: Taking the Guesswork Out of Language Model Evaluations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":17,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.353884Z"},"links":{"cited_paper":"/paper/2411.07237","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:a6462e1f0b67cb0772c6cdc34f08675057ef0c2c020529fd825e3588f88be912","observation_id":"0f429166-e12e-4055-bc4d-b0f351b5269b","resolution":{"observed_at":"2026-08-16T11:34:42.353884Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.159860Z","title":"Olausson, Jeevana Priya Inala, Chenglong Wang, Jianfeng Gao, and Armando Solar-Lezama","venue":null,"work_id":"be4c626c-5876-4353-9195-cf947f42dae2","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":18,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.359344Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:064c956dccd354b12891133005a99c3c926590aa5e067db3e2e93217d2be7f8f","observation_id":"4c71e040-0d1a-411e-9b3d-05ecea94e92f","resolution":{"observed_at":"2026-08-16T11:34:43.164788Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.364569Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":19,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.364569Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:6330646e66db9f7565dba3d647c4618c139c3df15ac1cf79ebbbf9dbd1a9ecde","observation_id":"3c210ad4-14a1-4870-89f0-2571ad844cf3","resolution":{"observed_at":"2026-08-16T11:34:42.364569Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.370900Z","title":"Do LLMs Plan Like Human Writers? Comparing Journalist Coverage of Press Releases with LLMs","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":20,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.370900Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:43f458c77608b63a9f7418d7a6d1d5c2ce6656e779c5f27e311409ff51184c8d","observation_id":"f1ff29d4-0a29-4ec6-9522-9d03deb9ac29","resolution":{"observed_at":"2026-08-16T11:34:42.370900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.375275Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":21,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.375275Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:8a1dd55c8c89cd29e98922a882c2b1af28a50eae6b6a6554ff74a70fa0501c5b","observation_id":"6b088437-5a3f-4471-9a81-7898f9261f3b","resolution":{"observed_at":"2026-08-16T11:34:42.375275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.123830Z","title":"Using natural language explanations to rescale human judgments","venue":null,"work_id":"2d5acb32-de82-4c29-9954-e518318d785c","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":22,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.380031Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:15b51679aeb498b838900cc1fca841b71f2f81447186fa48482063e48cac1863","observation_id":"b0386a8b-126c-45c7-ba52-a148b8c25294","resolution":{"observed_at":"2026-08-16T11:34:43.145289Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.384836Z","title":"Learning to Refine with Fine-Grained Natural Language Feedback","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":23,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.384836Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:a890e9408f9a6e8bee52885809cfb6ab7c2f94ea90429d95404eb29462295334","observation_id":"266acaca-ff34-41b3-84b9-c5aedf4f34f5","resolution":{"observed_at":"2026-08-16T11:34:42.384836Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.389900Z","title":"WritingBench: A Comprehensive Benchmark for Generative Writing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":24,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.389900Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:fdafc9b528673adcecc1c792049c96775ba07853a48de907b854955ba3b5e67a","observation_id":"61b8e228-8783-4e71-88c8-65c7bee1ed19","resolution":{"observed_at":"2026-08-16T11:34:42.389900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.103064Z","title":"Fine-Grained Human Feedback Gives Better Rewards for Language Model Training","venue":null,"work_id":"be0731f7-aad6-469a-a4ff-1c30390eefa1","year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":25,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.394755Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:d387339076d8c9c3436bc9f5b40fabdfb0409978b507535b1aef97ab1a350307","observation_id":"d6f90d70-e7da-4f5f-9053-a5fe3b0fe9b3","resolution":{"observed_at":"2026-08-16T11:34:43.108754Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.080482Z","title":"Hanjie, Runzhe Yang, and Karthik R Narasimhan","venue":null,"work_id":"c54e9ae6-3da3-4fb6-9a72-1f9ab0501721","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":26,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.402219Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:f8fce9d926cd0d07249149e64af67b865e7655aab31cc33618dbf618eec501eb","observation_id":"be34f127-a47e-4eab-a3cd-84903821029b","resolution":{"observed_at":"2026-08-16T11:34:43.089717Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.10020","last_updated":"2025-03-28T00:06:51Z","snapshot_observed_at":"2026-08-15T01:20:08.134494Z","submitted_at":"2024-01-18T14:43:47Z","title":"Self-Rewarding Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.10020","snapshot_observed_at":"2026-08-16T11:34:42.406977Z","title":"Self-Rewarding Language Models , 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":27,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.406977Z"},"links":{"cited_paper":"/paper/2401.10020","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:441b9e5dbaba3796b0bc4c484548c530ca91f20bc9d744bc3b656c8a6b4d336f","observation_id":"4f45d2a8-3615-4530-a97f-2505229d2333","resolution":{"observed_at":"2026-08-16T11:34:42.406977Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.046555Z","title":"Generative Verifiers: Reward Modeling as Next-Token Prediction","venue":null,"work_id":"b63f2143-7c6e-4677-8fc7-1eb230720427","year":2024},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":28,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.412226Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:87325a83c312acad1788ba3947dfaf8a8287913b92e5e6b88bea41daf4122b26","observation_id":"7e16b302-6e24-4253-b436-5ebc178351e8","resolution":{"observed_at":"2026-08-16T11:34:43.055058Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:43.018269Z","title":"Learning to Control the Specificity in Neural Response Generation","venue":null,"work_id":"cfe3440e-9166-49b1-bc26-1d913ea3bc9f","year":2018},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":29,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.416655Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:e6d7e03aad770e02b81a9b9f2a9f5a310388c96a5a1d66277a2f90e49d84d25f","observation_id":"82d1d276-15e5-4e96-becb-8f4aca36dc77","resolution":{"observed_at":"2026-08-16T11:34:43.024570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.988881Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","venue":null,"work_id":"fc22690a-3f3a-4290-8831-ee1c262b01d5","year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":30,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.421285Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:0698545e3850e2c2bc58eba643dfbfc30a1eca99b0d539894a2801e36d4aa15b","observation_id":"22ccd00a-76de-4e38-90c6-d54f38d16858","resolution":{"observed_at":"2026-08-16T11:34:42.997395Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-17T06:30:58.91139+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T11:34:42.425730Z","title":"Instruction-Following Evaluation for Large Language Models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":31,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.425730Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:85296a84a14f8d33bf04e9de609993f1887051eb0c91479731b17494425715aa","observation_id":"841621a3-eabb-478c-bcb5-bca8d6fbebdc","resolution":{"observed_at":"2026-08-16T11:34:42.425730Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.430515Z","title":"write newline","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":32,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.430515Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:4766e76f209f5b4c30d680314ec4ee08ce2446fcc223e77ed7818542d9a6d0f8","observation_id":"b70ff4d5-af34-457f-9fad-2c108ef8d972","resolution":{"observed_at":"2026-08-16T11:34:42.430515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.436029Z","title":"@esa (Ref","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":33,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.436029Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:5f6242faedec2c3b451d8e354bedccb631e11beab1ca19178e710dd74f135545","observation_id":"2ab15910-6e9c-4742-8b63-95b0ea2be823","resolution":{"observed_at":"2026-08-16T11:34:42.436029Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.441005Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":34,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.441005Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:15f6708e5cb5c370a8ccb7bf968635d701b585ccc2dd3967863f792f5687803a","observation_id":"b725652b-dc17-47ff-9468-f79dd0acbfac","resolution":{"observed_at":"2026-08-16T11:34:42.441005Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:34:42.445714Z","title":"HF f? -`U w DZYH+ RX AI 0 6g:B0ʁEڑD @Q Vx 6y!","venue":null,"work_id":null,"year":1920},"citing_paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web","version":2},"reference_index":35,"source":"arxiv_source","source_observed_at":"2026-08-16T11:34:42.445714Z"},"links":{"citing_paper":"/paper/2504.15219"},"observation_digest":"sha256:6229e9c790b82dd00a21e4bbd8dda44316f72f7406f91fc2217eb1ae0c39409d","observation_id":"749d0ce5-4339-44c9-bda6-780be7e3582a","resolution":{"observed_at":"2026-08-16T11:34:42.445714Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2504.15219","last_updated":"2025-08-18T02:17:20Z","latest_version":2,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T11:28:26.357575Z","submitted_at":"2025-04-21T16:43:50Z","title":"EvalAgent: Discovering Implicit Evaluation Criteria from the Web"},"reference_resolution":{"displayed":35,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":21,"verified_exact":0,"verified_fuzzy":14},"total_outbound_references":35},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-17T06:30:58.91139+00:00","source":"crossref"},{"observed_at":"2026-08-17T06:30:54.323127+00:00","source":"retraction_watch"}],"thesis":"As of 17 August 2026, this Paper Citation Record lists 35 of 35 outbound references and 2 inbound Pith citation observations for arXiv:2504.15219."}