{"as_of":"2026-08-19T20:24:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7db71037407dbe52414475f41ee691a697964be8f1f4fea2605edf45a2658075","coverage":[{"denominator":82,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":82,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-16T11:45:46.037186Z","state":"measured"},{"denominator":84,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":84,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-19T06:32:44.657259+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-04T23:03:16.449710Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-07-02T00:56:24.412552Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.14738","snapshot_observed_at":"2026-08-04T23:03:16.449710Z","title":"Parameswaran","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2509.06838","last_updated":"2025-09-08T16:08:31Z","snapshot_observed_at":"2026-08-09T03:57:38.609026Z","submitted_at":"2025-09-08T16:08:31Z","title":"EPT Benchmark: Evaluation of Persian Trustworthiness in Large Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-04T23:03:16.449710Z"},"links":{"cited_paper":"/paper/2504.14738","citing_paper":"/paper/2509.06838"},"observation_digest":"sha256:c8f1939b6e5cbc7ad306824b16acd325af5b14363dfe3d91be5be779bf382b50","observation_id":"31d48f05-84c0-4215-bce6-fd27eac3e6e0","resolution":{"observed_at":"2026-08-04T23:03:16.449710Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"cited_work":{"arxiv_id":"2504.14738","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2504.14738","snapshot_observed_at":"2026-07-02T00:56:24.412552Z","title":"PROMPTEV ALS: A dataset of assertions and guardrails for custom production large language model pipelines,","venue":null,"work_id":"76ec1c18-a7e1-4a08-b20a-6dbe545d16f2","year":2025},"citing_paper":{"arxiv_id":"2606.01513","last_updated":"2026-06-01T00:24:30Z","snapshot_observed_at":"2026-08-07T00:02:03.501606Z","submitted_at":"2026-06-01T00:24:30Z","title":"Compliance-Scored Best-of-N Guardrail Orchestration for Multimodal Document Generation in Payments Dispute Defense","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T13:13:05.210457Z"},"links":{"cited_paper":"/paper/2504.14738","citing_paper":"/paper/2606.01513"},"observation_digest":"sha256:4c33f64f4535ab458b9a17fd2d3e56537d9625ba197f4599d84a142ec45fdffd","observation_id":"7059f1bb-5aca-4c30-bd09-a8857d04b99b","resolution":{"observed_at":"2026-07-02T00:56:24.414603Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2504.14738/citation-record","integrity":"/paper/2504.14738/integrity","json":"/paper/2504.14738/citation-record.json","paper":"/paper/2504.14738"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.598024Z","title":null,"venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.598024Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:2ec9acbe3466f8591fa5969863d2e0f4e87311bd0c71f265431ca2193e7bf234","observation_id":"b901b01a-4ed9-4edf-8167-b58710e01634","resolution":{"observed_at":"2026-08-16T11:45:45.598024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.604047Z","title":"A survey on evaluation of large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.604047Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:1abe152fb43aefdf86813159f6aa161a4ed5188c85caecb04eb5650a2e6d429f","observation_id":"f5ff3c12-5408-45fb-a58d-8e2c86064f5f","resolution":{"observed_at":"2026-08-16T11:45:45.604047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.527615Z","title":"Benchmarking large language models in retrieval- augmented generation","venue":null,"work_id":"c1d54ab0-aaed-47e9-9bce-415edcdc837e","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.610178Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:479b8dc88af08155bf68963706118e44ff3079c3a2a5dafc36319eff03d980e9","observation_id":"488a3918-316b-4607-8253-81497ef95174","resolution":{"observed_at":"2026-08-16T11:45:47.532964Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2210.11416","last_updated":"2022-12-06T21:39:48Z","snapshot_observed_at":"2026-08-18T19:51:48.688199Z","submitted_at":"2022-10-20T16:58:32Z","title":"Scaling Instruction-Finetuned Language Models","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2210.11416","snapshot_observed_at":"2026-08-16T11:45:45.615201Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.615201Z"},"links":{"cited_paper":"/paper/2210.11416","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4c34585882041bd0dfd1ece81cf7221088ad8fb26f5b1143af26e8e5c28107b5","observation_id":"ae44640f-54c0-42ad-8b8d-c6c75d58a771","resolution":{"observed_at":"2026-08-16T11:45:45.615201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2110.14168","last_updated":"2021-11-18T00:23:45Z","snapshot_observed_at":"2026-08-14T02:43:01.480086Z","submitted_at":"2021-10-27T04:49:45Z","title":"Training Verifiers to Solve Math Word Problems","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2110.14168","snapshot_observed_at":"2026-08-16T11:45:45.625992Z","title":"Training verifiers to solve math word problems","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.625992Z"},"links":{"cited_paper":"/paper/2110.14168","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a5c409c17ecbc29cd48795dc4b88716c0db84718759c1aba0ae56439e727ab3d","observation_id":"3e65baf5-0e50-4cb5-8077-dfbe9a491c7b","resolution":{"observed_at":"2026-08-16T11:45:45.625992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.631360Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.631360Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:fdcc8e0edae03b0e481b96561906f2219c06e442e1b8d22eee44ac411362488b","observation_id":"efe3e18c-47ac-439e-b8e5-40d3605ef91a","resolution":{"observed_at":"2026-08-16T11:45:45.631360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.493787Z","title":"Building guardrails for large language models, 2024","venue":null,"work_id":"88026f01-851d-4eef-888c-da2f21818cd0","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.636201Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:f460ed46cad3cb749b58abb5096f9a6f014e5fc8476f3e6d201cb12980da8960","observation_id":"b7c47f3c-b09d-4a1a-8492-6ef813bf6831","resolution":{"observed_at":"2026-08-16T11:45:47.498491Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.477346Z","title":"Position: Building guardrails for large lan- guage models requires systematic design","venue":null,"work_id":"432fe2b3-a9db-4a23-b93d-923991a9a5eb","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.640898Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c0030fa0bcbdebf53a0b20d1e3c9af7458973da2ca78a9b437c6369a7bd9ab7f","observation_id":"79d0aa8e-347a-4190-9b11-0622c6381185","resolution":{"observed_at":"2026-08-16T11:45:47.482570Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.18322","last_updated":"2024-09-04T17:16:05Z","snapshot_observed_at":"2026-08-16T13:37:58.348497Z","submitted_at":"2024-07-01T19:52:41Z","title":"The Need for Guardrails with Large Language Models in Medical Safety-Critical Settings: An Artificial Intelligence Application in the Pharmacovigilance Ecosystem","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.18322","snapshot_observed_at":"2026-08-16T11:45:45.646404Z","title":"The need for guardrails with large language models in medical safety-critical settings: An artificial intelli- gence application in the pharmacovigilance ecosys- tem","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.646404Z"},"links":{"cited_paper":"/paper/2407.18322","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:baed06163e70d0326ca2e0d8cd10de25ab4c6f2001349a9116b7012ae5c1a0b6","observation_id":"06ce5c9a-9035-4956-b1e2-870a58381542","resolution":{"observed_at":"2026-08-16T11:45:45.646404Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-08-13T20:44:28.824685Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-16T11:45:45.651292Z","title":"Measuring massive multitask language understanding","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.651292Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a642bbf5a4dac506a34e794c8920cf4c205c1cc86d5f378c04180a903c91e39d","observation_id":"f5278d8e-716f-458d-a024-8f3a3e7798bc","resolution":{"observed_at":"2026-08-16T11:45:45.651292Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.661717Z","title":"Hu, Yelong Shen, Phillip Wallis, Zeyuan Allen-Zhu, Yuanzhi Li, Shean Wang, Lu Wang, and Weizhu Chen","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.661717Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:66c8d4b33747c64a09ee028e9983c0facb994dba4315351fa322dd0562f79520","observation_id":"ad2f9335-2a42-4c3b-97cd-50c8ca27ec14","resolution":{"observed_at":"2026-08-16T11:45:45.661717Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.05232","last_updated":"2024-11-19T12:42:45Z","snapshot_observed_at":"2026-07-06T16:45:07.733095Z","submitted_at":"2023-11-09T09:25:37Z","title":"A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.05232","snapshot_observed_at":"2026-08-16T11:45:45.666259Z","title":"A survey on hallucination in large language models: Principles, taxonomy, chal- lenges, and open questions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.666259Z"},"links":{"cited_paper":"/paper/2311.05232","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:53b5c1424a776eb3047d93a43f2827a3abeeabde3cfe4e41c7291463072afa05","observation_id":"a5d4ff67-f162-466b-bc8f-2028ad529c15","resolution":{"observed_at":"2026-08-16T11:45:45.666259Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.676124Z","title":"A survey on hallucination in large language models: Principles, taxonomy, challenges, and open questions, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.676124Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:35ee4c351f5d86deaa9ed4351f171382e86a56d53d9562771b3206aaeef419e8","observation_id":"1e003537-e495-4ca0-8d84-d5e293686b79","resolution":{"observed_at":"2026-08-16T11:45:45.676124Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2201.07207","last_updated":"2022-03-08T06:47:17Z","snapshot_observed_at":"2026-08-16T17:27:31.831243Z","submitted_at":"2022-01-18T18:59:45Z","title":"Language Models as Zero-Shot Planners: Extracting Actionable Knowledge for Embodied Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2201.07207","snapshot_observed_at":"2026-08-16T11:45:45.680628Z","title":"Abbeel, Deepak Pathak, and Igor Mordatch","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.680628Z"},"links":{"cited_paper":"/paper/2201.07207","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:1fa736a1412870edf6aa07ae56a3b660f138ea7409ec3ea9b6fc86f2baba3140","observation_id":"36e3c33a-0e1e-4dae-b339-85e612accfd8","resolution":{"observed_at":"2026-08-16T11:45:45.680628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.384507Z","title":"Beavertails: To- wards improved safety alignment of llm via a human- preference dataset","venue":null,"work_id":"f57c6b23-2a22-44bd-8f29-4caba852500a","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.690667Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:f67b3a6ba2bec85554cdd529152e6c8cfdf30e90654fd3ed652a3aab2287e31c","observation_id":"5e530c0d-f3ab-4900-ae0c-e65e7684a19c","resolution":{"observed_at":"2026-08-16T11:45:47.389839Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.368528Z","title":null,"venue":null,"work_id":"df50f0d9-c6d8-4cbd-bd76-57fa085ca571","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.695378Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:bb72c77e3a3007fa4d96f66d44cde90af28a7dbb3b6709e05817156d10c132fe","observation_id":"d1f83626-c98c-457f-a058-689473bb5c2d","resolution":{"observed_at":"2026-08-16T11:45:47.373470Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.14648","last_updated":"2024-03-20T02:21:20Z","snapshot_observed_at":"2026-08-18T19:44:50.790167Z","submitted_at":"2023-11-24T18:29:50Z","title":"Calibrated Language Models Must Hallucinate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.14648","snapshot_observed_at":"2026-08-16T11:45:45.700412Z","title":"Cal- ibrated language models must hallucinate","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.700412Z"},"links":{"cited_paper":"/paper/2311.14648","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a17ba9246be82e331059847d5a08809fb30831a2857ab3f4011113a251461717","observation_id":"3720bc09-8959-4fd2-9358-e9048911c4a6","resolution":{"observed_at":"2026-08-16T11:45:45.700412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.401950Z","title":null,"venue":null,"work_id":"779d49c4-23b2-4296-9235-663981d6e85f","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.685736Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:bf185bcacc7641e28db201fc08a96483e8656f5a4d78000e5e8799845c04694b","observation_id":"8e8fa19b-e235-4fe7-9ce3-7e752b768eda","resolution":{"observed_at":"2026-08-16T11:45:47.408977Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.350463Z","title":"Prometheus: Inducing fine-grained evaluation capa- bility in language models","venue":null,"work_id":"7a660bbc-0959-4b3b-a1ba-33b01acc086b","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.710859Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:50c79e8c450d541991790afb7df63582ba2a7ac86ec8d5c782bcbd7bc65615a0","observation_id":"e0c8dc2e-15ba-4271-ba5f-716384b8a77c","resolution":{"observed_at":"2026-08-16T11:45:47.356131Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.01535","last_updated":"2024-12-04T19:23:17Z","snapshot_observed_at":"2026-08-16T13:55:51.395455Z","submitted_at":"2024-05-02T17:59:35Z","title":"Prometheus 2: An Open Source Language Model Specialized in Evaluating Other Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2405.01535","snapshot_observed_at":"2026-08-16T11:45:45.715779Z","title":"Prometheus 2: An open source language model specialized in evaluating other language mod- els","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.715779Z"},"links":{"cited_paper":"/paper/2405.01535","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:640f5ed694ceeb3b4f3c2bdcc7867b5e04feeb20050b59113262cc9f8056a5b5","observation_id":"f0e28339-24c1-4110-8269-34221fde98fb","resolution":{"observed_at":"2026-08-16T11:45:45.715779Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.332808Z","title":"Evallm: Interactive evaluation of large language model prompts on user-defined cri- teria","venue":null,"work_id":"b05a37b5-fc7c-4d41-9163-8e47d966bd0e","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.722034Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:08a6a131908dc19723d7c4f12da5431ce8ba0d1bbe161c9bb3415eb7b3398815","observation_id":"d1716994-9a5c-4db6-b47a-946941e86fdf","resolution":{"observed_at":"2026-08-16T11:45:47.338952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03714","last_updated":"2023-10-05T17:37:25Z","snapshot_observed_at":"2026-08-04T05:21:05.846165Z","submitted_at":"2023-10-05T17:37:25Z","title":"DSPy: Compiling Declarative Language Model Calls into Self-Improving Pipelines","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03714","snapshot_observed_at":"2026-08-16T11:45:45.705973Z","title":"Dspy: Compiling declarative language model calls into self-improving pipelines","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.705973Z"},"links":{"cited_paper":"/paper/2310.03714","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:684e3a3ac5e6b8011a8d9265d23ceaa8fc84b0fe32f964eb46be35d8af0e6d14","observation_id":"274f6e81-4c26-4c67-b168-473a6b47cc06","resolution":{"observed_at":"2026-08-16T11:45:45.705973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.314719Z","title":"Openassistant conversations- democratizing large language model alignment","venue":null,"work_id":"2cd605d1-eb91-4e77-8ef3-bab780589ea7","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.732360Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:fc52fb8a0685bf6273f2a34169f00f4ed540e17b0cb57eb36966b2ca0a9d0ccf","observation_id":"0e832080-5ac4-4fd8-8160-81f268867e7f","resolution":{"observed_at":"2026-08-16T11:45:47.320144Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.737081Z","title":"The power of scale for parameter-efficient prompt tuning, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.737081Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a65767d0320450e92cc2a2d3e66e7c956f284dbf4eeecd2257e91d324109d270","observation_id":"8dc9c929-ac88-4ff2-8750-43c3ba4acf12","resolution":{"observed_at":"2026-08-16T11:45:45.737081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.05470","last_updated":"2023-12-07T08:48:36Z","snapshot_observed_at":"2026-08-16T14:53:56.793203Z","submitted_at":"2023-10-09T07:27:15Z","title":"Generative Judge for Evaluating Alignment","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.05470","snapshot_observed_at":"2026-08-16T11:45:45.742303Z","title":"Generative judge for evaluating alignment","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.742303Z"},"links":{"cited_paper":"/paper/2310.05470","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:24786a415b38e03e1d54517c6a49896e8322f0b515808092df21c3e4717dc6d0","observation_id":"6536f886-cbc8-4ebe-bc2e-339586c5b769","resolution":{"observed_at":"2026-08-16T11:45:45.742303Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.11916","last_updated":"2023-01-29T05:14:17Z","snapshot_observed_at":"2026-08-13T05:54:24.242465Z","submitted_at":"2022-05-24T09:22:26Z","title":"Large Language Models are Zero-Shot Reasoners","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.11916","snapshot_observed_at":"2026-08-16T11:45:45.727076Z","title":"Large language models are zero-shot reasoners","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.727076Z"},"links":{"cited_paper":"/paper/2205.11916","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:2073e19760f8873f748f782682cce45e5534460d220cbb43d28228f11dde37c9","observation_id":"f94e8bd8-78a9-429c-a1f5-a997529424f1","resolution":{"observed_at":"2026-08-16T11:45:45.727076Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.757425Z","title":"we need structured output","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.757425Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:62a6ae9eb5e46f296645649c016434f0854847d0bc6c6a994cecf6f4402fde02","observation_id":"3180c99d-4c35-4a7e-958c-f08bd0d8ed48","resolution":{"observed_at":"2026-08-16T11:45:45.757425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03688","last_updated":"2025-10-04T03:54:18Z","snapshot_observed_at":"2026-08-16T00:51:32.846970Z","submitted_at":"2023-08-07T16:08:11Z","title":"AgentBench: Evaluating LLMs as Agents","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03688","snapshot_observed_at":"2026-08-16T11:45:45.762328Z","title":"Agentbench: Evaluating llms as agents","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.762328Z"},"links":{"cited_paper":"/paper/2308.03688","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6498ed2eaf090d505a26642e5184c51c4f371dda437d0cc597ba16549d627915","observation_id":"3663e3a0-a886-4c6b-a139-d7844988bbf1","resolution":{"observed_at":"2026-08-16T11:45:45.762328Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.772647Z","title":"Decoupled weight decay regularization, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.772647Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:0732c2df0ea6cd90732fdff62324993c73be4c73e9e5d89925250af6875d7416","observation_id":"b3d22441-5c7f-43dc-a969-af498014db4e","resolution":{"observed_at":"2026-08-16T11:45:45.772647Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.286375Z","title":null,"venue":null,"work_id":"e4ebcda6-f396-4c5d-ab18-1094cd4e0724","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.747693Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b7272fd71b2906bc1d554cdc9375eb59d96ae63ef62468244892f30d3cc1fb53","observation_id":"619be15f-e175-44ef-bb9e-28a74e900633","resolution":{"observed_at":"2026-08-16T11:45:47.291139Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2101.00190","last_updated":"2021-01-01T08:00:36Z","snapshot_observed_at":"2026-08-12T12:37:28.207761Z","submitted_at":"2021-01-01T08:00:36Z","title":"Prefix-Tuning: Optimizing Continuous Prompts for Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2101.00190","snapshot_observed_at":"2026-08-16T11:45:45.752370Z","title":"Prefix-tuning: Op- timizing continuous prompts for generation","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.752370Z"},"links":{"cited_paper":"/paper/2101.00190","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:35297242a10dd49cd100e81afc8907c6b7636f1fbe125a7708c5c77947b131ed","observation_id":"210b601d-7eac-4dc7-b26d-3a8e452fc914","resolution":{"observed_at":"2026-08-16T11:45:45.752370Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.02155","last_updated":"2022-03-04T07:04:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-04T07:04:42Z","title":"Training language models to follow instructions with human feedback","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.02155","snapshot_observed_at":"2026-08-16T11:45:45.787280Z","title":"Wainwright, Pamela Mishkin, Chong Zhang, Sandhini Agarwal, Katarina Slama, Alex Ray, John Schulman, Jacob Hilton, Fraser Kelton, Luke E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.787280Z"},"links":{"cited_paper":"/paper/2203.02155","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:65ab8dd8080df19da0d29ecadda925e0aeb95b787b8b4f133653308926c9eedf","observation_id":"f79ed5c4-1b2b-486a-a34b-9990610a5bbd","resolution":{"observed_at":"2026-08-16T11:45:45.787280Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03188","last_updated":"2023-08-30T03:47:34Z","snapshot_observed_at":"2026-08-16T15:10:27.193437Z","submitted_at":"2023-08-06T18:38:52Z","title":"Automatically Correcting Large Language Models: Surveying the landscape of diverse self-correction strategies","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03188","snapshot_observed_at":"2026-08-16T11:45:45.797125Z","title":"Automatically correcting large language models: Surveying the landscape of diverse self- correction strategies","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.797125Z"},"links":{"cited_paper":"/paper/2308.03188","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c1e3363f69f30365144be25f076f5ee61f543271a599f4161c6597bcda3382db","observation_id":"288860c4-71b6-4e34-9c4e-29dc77767097","resolution":{"observed_at":"2026-08-16T11:45:45.797125Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.269854Z","title":null,"venue":null,"work_id":"cff87aa1-2f6d-4f9b-829f-cd7cc060f247","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.768012Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:287b40bd95971949852ba586c02117f62a72d7e0e9214299c80831cc122b3a56","observation_id":"4357f14c-b418-4627-857d-89978d5436bb","resolution":{"observed_at":"2026-08-16T11:45:47.275030Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.207460Z","title":"Nemo guardrails: A toolkit for controllable and safe llm applications with programmable rails, 2023","venue":null,"work_id":"60ccfeb0-14dd-494d-9bd3-51368cbac2ba","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.811054Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c403afbb768a3fe854ecf4c2872aca4bad8bf8c553d3afeb519713e801029b33","observation_id":"d22336fe-8408-4966-b786-98575d1ca461","resolution":{"observed_at":"2026-08-16T11:45:47.212247Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01452","last_updated":"2024-07-24T15:53:29Z","snapshot_observed_at":"2026-08-16T21:47:08.048614Z","submitted_at":"2024-07-24T15:53:29Z","title":"Building a Domain-specific Guardrail Model in Production","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01452","snapshot_observed_at":"2026-08-16T11:45:45.777364Z","title":"Building a domain-specific guardrail model in pro- duction","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.777364Z"},"links":{"cited_paper":"/paper/2408.01452","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:64886b2f752945bbbf2d368b5be44dd2b45b2df72a969cd3c21a46f49a8c68d5","observation_id":"dbf368e9-f11e-4258-bb31-b99b4dea5e95","resolution":{"observed_at":"2026-08-16T11:45:45.777364Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-08-17T09:58:46.058102Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-16T11:45:45.782427Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.782427Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:44db3574d06c5eb3ae3234033453ea40c8e6afaf2ddfe13e86879d78af259613","observation_id":"6edcdd71-a4cb-438c-a234-20fc26ab71b6","resolution":{"observed_at":"2026-08-16T11:45:45.782427Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12272","last_updated":"2024-04-18T15:45:27Z","snapshot_observed_at":"2026-08-16T13:59:43.109861Z","submitted_at":"2024-04-18T15:45:27Z","title":"Who Validates the Validators? Aligning LLM-Assisted Evaluation of LLM Outputs with Human Preferences","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12272","snapshot_observed_at":"2026-08-16T11:45:45.825085Z","title":"Who validates the validators? aligning llm-assisted evaluation of llm outputs with human preferences","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.825085Z"},"links":{"cited_paper":"/paper/2404.12272","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:e0334973c1bd0337ffd5e0f5a5c4ed762b57f746fe03c0e5ef6912995186bf1f","observation_id":"44b15ade-cfe4-4a99-9b08-a22b21cbd5ff","resolution":{"observed_at":"2026-08-16T11:45:45.825085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.239361Z","title":null,"venue":null,"work_id":"804dc806-4b1b-4c15-a201-8654ea797565","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.792397Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:ebfc34c00b11377d5091c1e37d99e465a5215fc470c66307ad4bed99427a504a","observation_id":"e24694fc-c858-46a5-a4a6-d3e6c7d1a4f7","resolution":{"observed_at":"2026-08-16T11:45:47.244480Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2206.04615","last_updated":"2023-06-12T17:51:15Z","snapshot_observed_at":"2026-07-06T13:19:12.109592Z","submitted_at":"2022-06-09T17:05:34Z","title":"Beyond the Imitation Game: Quantifying and extrapolating the capabilities of language models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2206.04615","snapshot_observed_at":"2026-08-16T11:45:45.834521Z","title":"Brown, Adam Santoro, Aditya Gupta, Adrià Garriga-Alonso, Agnieszka Kluska, Aitor Lewkowycz, Akshat Agarwal, Alethea Power, Alex Ray, Alex Warstadt, Alexander W","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.834521Z"},"links":{"cited_paper":"/paper/2206.04615","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:45f8efc1453cbe680698dfa8f3ef080c6f514d05d556aa6b3922f1af2bbc8b62","observation_id":"56bf4edd-bab2-4968-a5ca-d04e052f6cee","resolution":{"observed_at":"2026-08-16T11:45:45.834521Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.223361Z","title":null,"venue":null,"work_id":"579804c9-576a-4327-8651-7cd0ca2ed1af","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.801812Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:030836658f53ed5ff60b81e6309464667fdb7b3379a79c4482946245196a2535","observation_id":"53d0e489-b290-49b4-b232-b077b7969025","resolution":{"observed_at":"2026-08-16T11:45:47.228112Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2401.03601","last_updated":"2024-01-07T23:01:56Z","snapshot_observed_at":"2026-08-18T04:22:46.289012Z","submitted_at":"2024-01-07T23:01:56Z","title":"InFoBench: Evaluating Instruction Following Ability in Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2401.03601","snapshot_observed_at":"2026-08-16T11:45:45.806425Z","title":"Infobench: Eval- uating instruction following ability in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.806425Z"},"links":{"cited_paper":"/paper/2401.03601","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:91434cab6b7e458982502a9d9df9ff7034baf46f07b4685605920ef5d92aec08","observation_id":"a781cdcd-9cec-4530-b146-04143e365e7a","resolution":{"observed_at":"2026-08-16T11:45:45.806425Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05087","last_updated":"2024-05-24T06:37:31Z","snapshot_observed_at":"2026-08-16T15:25:32.155059Z","submitted_at":"2023-06-08T10:41:56Z","title":"PandaLM: An Automatic Evaluation Benchmark for LLM Instruction Tuning Optimization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05087","snapshot_observed_at":"2026-08-16T11:45:45.853992Z","title":"Pandalm: An automatic evaluation benchmark for llm instruc- tion tuning optimization","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.853992Z"},"links":{"cited_paper":"/paper/2306.05087","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:3f88a27563b02773572b96ed6724c2f086d83b55b2baf96292ddbd65326b91ed","observation_id":"6196b8d1-9e22-4a3a-9b08-9494653f8cda","resolution":{"observed_at":"2026-08-16T11:45:45.853992Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.07927","last_updated":"2025-03-16T06:23:34Z","snapshot_observed_at":"2026-08-16T14:09:52.485275Z","submitted_at":"2024-02-05T19:49:13Z","title":"A Systematic Survey of Prompt Engineering in Large Language Models: Techniques and Applications","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.07927","snapshot_observed_at":"2026-08-16T11:45:45.815644Z","title":"A systematic survey of prompt engineering in large lan- guage models: Techniques and applications","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.815644Z"},"links":{"cited_paper":"/paper/2402.07927","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:90c37597fa5632331b23181c178f07b3d507f794388cededbdc5f21025ac3872","observation_id":"6b3f1be4-9cfb-4a50-a81b-f077668b6dc1","resolution":{"observed_at":"2026-08-16T11:45:45.815644Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.191197Z","title":null,"venue":null,"work_id":"38bf8e87-e93a-4fe6-a87f-29dd6091b593","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.820510Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:42ec851c92d9cca833a0d987b99a7afa9d7f2b15ab3de4491fd1a6ef687c7c9e","observation_id":"526f8b7d-9bbc-4864-bbfa-8fe6fa4d1f69","resolution":{"observed_at":"2026-08-16T11:45:47.196931Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.091128Z","title":"Chain-of-thought prompting elicits rea- soning in large language models","venue":null,"work_id":"43e187ea-d8c2-46a7-b235-85aaf544bc33","year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.874816Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a38734793aeee3b1a496e9f4cdaf8759f87355010e33ee9db5b5b100971873e3","observation_id":"0e71b4f6-d5a0-4e40-8339-9e39560a161b","resolution":{"observed_at":"2026-08-16T11:45:47.096334Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.829858Z","title":"Towards better evaluation of instruction-following: A case-study in summariza- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.829858Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9b728c9e8772bb12cabf93621c2858ac00f2e4c71a59a6dbca3f227621d6dee3","observation_id":"177924f0-8eb1-4319-9b61-26e81e901105","resolution":{"observed_at":"2026-08-16T11:45:45.829858Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:45.885020Z","title":"Weinberger, and Yoav Artzi","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.885020Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:03b34d302939d133a45689c411b7db9bfddcf18cec70ca116c2340dfacd1ba2f","observation_id":"39f165bc-fc5c-4462-ae7e-99357d4bef12","resolution":{"observed_at":"2026-08-16T11:45:45.885020Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.174212Z","title":null,"venue":null,"work_id":"46b74d28-f04a-4e2e-9706-d07b31b1e308","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.839730Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:0ac5125482c0b3318334a5b65f791c0745c44652c4be7b428b3b7ea4861d7d0b","observation_id":"133beb70-e2ad-4713-a13f-91bda165f224","resolution":{"observed_at":"2026-08-16T11:45:47.178942Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.158219Z","title":"Llama: Open and efficient foundation language mod- els, 2023","venue":null,"work_id":"8f3052ae-ebaa-40bf-91ef-f67cbb155735","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.844536Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:19df916995097cf34f1849f9f477f8ccbf5ce281cf011735c401f04602c8951b","observation_id":"135fee25-b8ff-4b08-8f6c-1c2e3bb68252","resolution":{"observed_at":"2026-08-16T11:45:47.163088Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.141093Z","title":"Replacing judges with juries: Evaluating llm genera- tions with a panel of diverse models, 2024","venue":null,"work_id":"112eecd1-f253-4b1f-ab43-1042e4143638","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.849158Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a45f3a1eb6620b68fe6273397b1f8bd3d6906241219c8658de80f12e02cc59df","observation_id":"6fac03f7-f32e-43d3-9057-4cc1acc73170","resolution":{"observed_at":"2026-08-16T11:45:47.146168Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2311.07911","last_updated":"2023-11-14T05:13:55Z","snapshot_observed_at":"2026-07-06T16:47:08.877195Z","submitted_at":"2023-11-14T05:13:55Z","title":"Instruction-Following Evaluation for Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.07911","snapshot_observed_at":"2026-08-16T11:45:45.908023Z","title":"Instruction-following evalu- ation for large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.908023Z"},"links":{"cited_paper":"/paper/2311.07911","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:2e1b45689bea12ed074b68620c73be4128a52372798fca08317b52c69152f80c","observation_id":"8bf6f4d6-3eab-4498-ae9d-106f9a2f8fb5","resolution":{"observed_at":"2026-08-16T11:45:45.908023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.125298Z","title":null,"venue":null,"work_id":"363e5b5e-c658-4958-8ee0-01531339fb15","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.859420Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:588591f2304f73b55f5b4432daee449eaa213df56c8282837a08804044266830","observation_id":"a552e413-4851-41a2-a4aa-7014270cb7de","resolution":{"observed_at":"2026-08-16T11:45:47.130133Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.106886Z","title":"Smith, Daniel Khashabi, and Hannaneh Hajishirzi","venue":null,"work_id":"523ce473-91f9-4990-9a69-a5bb42e4a42e","year":2022},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.865143Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:1170c55ac779f97db3a62f388e8df5ab037e56a8891d269d5a7d9cfd4d087b04","observation_id":"1c7a7725-7b20-4c95-a622-f23cf3caa8fd","resolution":{"observed_at":"2026-08-16T11:45:47.112691Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.01652","last_updated":"2022-02-08T20:26:45Z","snapshot_observed_at":"2026-08-14T06:11:14.515796Z","submitted_at":"2021-09-03T17:55:52Z","title":"Finetuned Language Models Are Zero-Shot Learners","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2109.01652","snapshot_observed_at":"2026-08-16T11:45:45.870237Z","title":"Dai, and Quoc V","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.870237Z"},"links":{"cited_paper":"/paper/2109.01652","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b63b3a647fa34780e4345abbff03ee0da78bdc97db6840b8e78f1eccda95ee88","observation_id":"c86f39ce-a741-45bd-ad4f-452d10ca4f97","resolution":{"observed_at":"2026-08-16T11:45:45.870237Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.074426Z","title":"Evaluating large lan- guage models at evaluating instruction following","venue":null,"work_id":"172bdd6b-a950-4aab-ad8b-8a4d5bba6aa2","year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.879618Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b764b598e2c4433213f1fefc770ab31511f2cd911b24674841497c26be3934ee","observation_id":"277e5ca9-9c84-4f16-84e0-8f05d7b10d73","resolution":{"observed_at":"2026-08-16T11:45:47.080012Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2309.11998","last_updated":"2024-03-10T19:34:57Z","snapshot_observed_at":"2026-08-18T19:38:46.345325Z","submitted_at":"2023-09-21T12:13:55Z","title":"LMSYS-Chat-1M: A Large-Scale Real-World LLM Conversation Dataset","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.11998","snapshot_observed_at":"2026-08-16T11:45:45.889821Z","title":"Xing, Joseph E","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.889821Z"},"links":{"cited_paper":"/paper/2309.11998","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4d61554de5ff8138b51ff9fe29577bf4edab6d7866f461c1ca09526b67662b4f","observation_id":"f9d903cb-e641-40d6-a474-0e9deace0733","resolution":{"observed_at":"2026-08-16T11:45:45.889821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.045089Z","title":null,"venue":null,"work_id":"edffb05d-bee6-4d34-b80a-81aa9d4e1b0c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.894590Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:d0d54af538a800cfaa5040d6a31fa40337efb267aceced98c7bc098c5088adb0","observation_id":"25fb6b3f-dad6-43fb-aca5-d7d1043a60da","resolution":{"observed_at":"2026-08-16T11:45:47.050199Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.029854Z","title":"Xing, Hao Zhang, Joseph E","venue":null,"work_id":"02cdeb07-d4e1-49fc-be20-22225aca3d12","year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.898912Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:ff43627b3566054c02778f147f498cba44a007730db4f966d0d9c7e672134de6","observation_id":"7721e4c3-07b5-4062-8890-28b857b88ca4","resolution":{"observed_at":"2026-08-16T11:45:47.034762Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05685","last_updated":"2023-12-24T02:01:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-09T05:55:52Z","title":"Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05685","snapshot_observed_at":"2026-08-16T11:45:45.903551Z","title":"Xing, Hao- tong Zhang, Joseph Gonzalez, and Ion Stoica","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.903551Z"},"links":{"cited_paper":"/paper/2306.05685","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:c3f51441b9746e49677e8f874bdf0e5b514c245bebd0a72b23df6a6f9855905f","observation_id":"2d461559-1043-4562-9b8c-84688af7088f","resolution":{"observed_at":"2026-08-16T11:45:45.903551Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.17631","last_updated":"2025-03-01T17:06:43Z","snapshot_observed_at":"2026-08-18T04:53:42.954410Z","submitted_at":"2023-10-26T17:48:58Z","title":"JudgeLM: Fine-tuned Large Language Models are Scalable Judges","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.17631","snapshot_observed_at":"2026-08-16T11:45:45.913862Z","title":"Judgelm: Fine-tuned large language mod- els are scalable judges","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.913862Z"},"links":{"cited_paper":"/paper/2310.17631","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6f317c6d150f26ebeb21b7945819f3d0e46fa5c6958f740e4181bf125e4013f0","observation_id":"309c28c3-d6aa-4bd5-8de6-3761cc7184f8","resolution":{"observed_at":"2026-08-16T11:45:45.913862Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.013151Z","title":null,"venue":null,"work_id":"2643046b-9f6a-4eb1-85f8-ebe13d0a7447","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.919420Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4239ef657e1144c70d749447dfbe68d0c9d8957721d2d43275b021959a502267","observation_id":"10b0f052-dad6-409e-b47d-feb2f0a22263","resolution":{"observed_at":"2026-08-16T11:45:47.018240Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.13304","last_updated":"2023-06-23T05:43:28Z","snapshot_observed_at":"2026-08-19T05:45:53.973699Z","submitted_at":"2023-06-23T05:43:28Z","title":"ToolQA: A Dataset for LLM Question Answering with External Tools","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.13304","snapshot_observed_at":"2026-08-16T11:45:45.925042Z","title":"‘json “‘ markers, with the key “field","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.925042Z"},"links":{"cited_paper":"/paper/2306.13304","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:eaaa4e6a4a9ecfeec6b510a2f8d0d1f78136523fd314cb33769705b8931a5ef5","observation_id":"79a0b9a5-63ee-4223-b57b-efb430a64e12","resolution":{"observed_at":"2026-08-16T11:45:45.925042Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.996876Z","title":null,"venue":null,"work_id":"81e8e3b6-e13d-45f6-9c71-4f5e9b7807eb","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.930886Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6f937f19e6ad567bd05b0f6c1f524048f30cd77c6589d848aeaba38a64230935","observation_id":"c0222959-098b-4808-b091-2c37d972ca3f","resolution":{"observed_at":"2026-08-16T11:45:47.002483Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.979025Z","title":null,"venue":null,"work_id":"11ffcb36-2aba-4839-a472-1d1be8d8e23c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.936349Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9f567b072acbe354e87e2f6503d959e1bdf686979ed5e4c4cbcd9b6b6882107b","observation_id":"79b9c25e-d5ef-42a4-a1e5-3e61a6191a7b","resolution":{"observed_at":"2026-08-16T11:45:46.984432Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.961029Z","title":"We removed any rows that resulted in 0 assertion criteria after the first step of our 3 step workflow","venue":null,"work_id":"04e7d29f-9933-4166-85b0-1d3509b0cba8","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.941690Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:54afd6a7625d867767691fb87ef8bfbbdca2d4ae7d6205100c7f7029e2ea1603","observation_id":"b897493f-b0fc-44bf-a391-aaa49cebde7e","resolution":{"observed_at":"2026-08-16T11:45:46.966264Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.943841Z","title":"They can delete their prompts by submitting a delete request","venue":null,"work_id":"61558d0b-7fd5-4387-91ac-9c2478026982","year":2000},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.946586Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:d1abc4b577f193f702af542688756f54223c689b94dbcb0cf58f730ac33daa7b","observation_id":"4ed307bc-c492-4f0d-8e49-fd2286ebe6b1","resolution":{"observed_at":"2026-08-16T11:45:46.948952Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.927681Z","title":"D Model Cards D.1 Fine-tuned Mistral","venue":null,"work_id":"0f36e493-7b21-458e-a674-dffa34f4b1f5","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.951389Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:96e4cd555b9113f228d0a7e0034e907222418df02fe2b5fa8efdc82aa8d7ff36","observation_id":"1e4a96fd-d21f-4a95-98bf-ad1eb6f373d6","resolution":{"observed_at":"2026-08-16T11:45:46.933049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.823618Z","title":null,"venue":null,"work_id":"9170d59d-c30b-4d45-be60-3dac1a91494e","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.985574Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:dbcd467df12efc7ce860378bc9b29c4357f65a7e651cb28ba6f5cb6878706242","observation_id":"d6c6ed5a-007d-4d52-aa74-52452fa2d3db","resolution":{"observed_at":"2026-08-16T11:45:46.828499Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.789610Z","title":null,"venue":null,"work_id":"17a4d006-9586-4fba-9baf-a904342e5159","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.995064Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:a32e5f39865ae182557f6e3b9d1dc7e897dd7c2adb99645cf3b71c83f7c8b15e","observation_id":"d98f6bd3-88a5-4f31-a726-d240cdac249b","resolution":{"observed_at":"2026-08-16T11:45:46.794475Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.06825","last_updated":"2023-10-10T17:54:58Z","snapshot_observed_at":"2026-08-17T20:30:34.016254Z","submitted_at":"2023-10-10T17:54:58Z","title":"Mistral 7B","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.06825","snapshot_observed_at":"2026-08-16T11:45:45.999802Z","title":"Basic information about the model","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.999802Z"},"links":{"cited_paper":"/paper/2310.06825","citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:e3a0dcb164db00ea3bb3ec253249e104155db5234f7904f09a263dee75312253","observation_id":"bffc8536-63f3-4650-b3d8-b390c0d1fb80","resolution":{"observed_at":"2026-08-16T11:45:45.999802Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.910394Z","title":"Use cases that were envisioned during development","venue":null,"work_id":"81963a15-4cf9-4c60-a6ee-92de2639408c","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.004533Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:89dcbbe3bacd88c143ff998c234582f4221a389e9e9280c3c7755b1dc9d4e8bc","observation_id":"5d760eae-b7c6-4f44-bc33-d5456cd46f21","resolution":{"observed_at":"2026-08-16T11:45:46.915880Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.893595Z","title":"Factors could include demographic or phenotypic groups, environmental conditions, techni- cal attributes, or others listed in Section 4.3","venue":null,"work_id":"30c576a4-51d5-4d1f-96c7-f3597a8c3cf7","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.009056Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:f4ddfe236ac7687c7cf2281a1dceb8c60ab6b1514148b9510af244c92e248de3","observation_id":"6e18393f-72c6-4857-9875-baf4f53e1d56","resolution":{"observed_at":"2026-08-16T11:45:46.898673Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.876017Z","title":"Metrics should be chosen to reflect potential realworld impacts of the model","venue":null,"work_id":"487776f7-0bbe-4be2-8e57-b8a56075d169","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.013723Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:d0d30d652c50add374be6277a85556f074bc31a9f1008945182ec4c7ffe74701","observation_id":"e9563528-c2b1-4830-b174-3be16e235ba5","resolution":{"observed_at":"2026-08-16T11:45:46.882845Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.857617Z","title":null,"venue":null,"work_id":"b1dd3b38-e881-4bb8-8675-df0b03c8d0c7","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.018747Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:956c1f183c433d5827009e58e948e0ef92efd8377235076eb6aea2177254c944","observation_id":"32faf122-e630-4217-840b-bf1b8024aaf3","resolution":{"observed_at":"2026-08-16T11:45:46.862800Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.840425Z","title":null,"venue":null,"work_id":"0c657cd9-ad94-4743-a3cb-8214f819aad6","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.023756Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:35defcd64c45da47d16402095f1271058d37002c94b7beef3d166d508ae80f9a","observation_id":"740cbf64-9aed-4c1c-babf-4868c9362137","resolution":{"observed_at":"2026-08-16T11:45:46.845860Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.772848Z","title":null,"venue":null,"work_id":"4df886f0-09b6-44f5-8901-0d3dd1df86f1","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.028136Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:6bfcf4d06430a259f07145e230273733bfae9477529d5ad70b8c3592d3c064ee","observation_id":"427c3e6e-52f1-4ba9-adf3-ec842877cf5f","resolution":{"observed_at":"2026-08-16T11:45:46.777919Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.807389Z","title":null,"venue":null,"work_id":"1d48d6ad-862a-4cf2-8e7b-de1a310bb1ce","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.032651Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:9b081f90dab171ae523d76b6a93e9c21c68d4b45bbf26e9ca3ede048b2539c43","observation_id":"413abb1f-ae8f-4c20-adae-f81d6dea108a","resolution":{"observed_at":"2026-08-16T11:45:46.812413Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:46.747067Z","title":null,"venue":null,"work_id":"b51f60e9-814d-42f0-8333-142c2603c8dd","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:46.037186Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:17b5c30733aef6b0a657473c454da95bd18cbc94ad8cf81f50545f40a4f009c6","observation_id":"bc87f790-024a-4ed2-a5ff-9a007cec2fac","resolution":{"observed_at":"2026-08-16T11:45:46.754011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.460427Z","title":null,"venue":null,"work_id":"046ee91f-6f81-4192-82fe-44a69495ba9a","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2020,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.657044Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:b3be9244bcd97a82ab4d12db43e5ca170fa45ab06fa2f1944da0a9010381c1b2","observation_id":"f47334ec-ab47-45df-9440-5b31a9a87084","resolution":{"observed_at":"2026-08-16T11:45:47.465252Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.509988Z","title":null,"venue":null,"work_id":"9f0e1dfb-6342-49d1-8695-c21ac925c4a1","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.621062Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:938bf859a36f368d87b9c2b0c0ed450e5a759d1a7af20558d987a6c11c42aa79","observation_id":"7c7a9835-2b75-4187-8d53-97a18fa92e35","resolution":{"observed_at":"2026-08-16T11:45:47.515350Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-16T11:45:47.433772Z","title":null,"venue":null,"work_id":"ef8eb6c1-357b-4231-a610-0edb126fffbd","year":null},"citing_paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines","version":1},"reference_index":2023,"source":"pdf_text","source_observed_at":"2026-08-16T11:45:45.671082Z"},"links":{"citing_paper":"/paper/2504.14738"},"observation_digest":"sha256:4723ea86f222a650238b8dc49956f29f8f60a984feb7769fd868622a2df7a096","observation_id":"e786a326-ac76-40ca-abe2-1d95e563df32","resolution":{"observed_at":"2026-08-16T11:45:47.438874Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-19T06:32:44.657259+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2504.14738","last_updated":"2025-04-20T21:04:23Z","latest_version":1,"primary_category":"cs.CL","snapshot_observed_at":"2026-08-16T14:25:43.368824Z","submitted_at":"2025-04-20T21:04:23Z","title":"PROMPTEVALS: A Dataset of Assertions and Guardrails for Custom Production Large Language Model Pipelines"},"reference_resolution":{"displayed":82,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":62,"verified_exact":0,"verified_fuzzy":20},"total_outbound_references":82},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-19T06:32:44.657259+00:00","source":"crossref"},{"observed_at":"2026-08-19T06:32:39.956319+00:00","source":"retraction_watch"}],"thesis":"As of 19 August 2026, this Paper Citation Record lists 82 of 82 outbound references and 2 inbound Pith citation observations for arXiv:2504.14738."}