{"as_of":"2026-08-08T00:40:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a57cd9b92340dd730e650d3d7f56b144eb2baac7e8de5e09175772f91d9afb51","coverage":[{"denominator":70,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":70,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T11:10:45.767347Z","state":"measured"},{"denominator":72,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":72,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":2,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":2,"source":"paper_references, paper_reference_links","source_observed_at":"2026-05-22T03:53:03.807297Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-22T03:54:34.003611Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"cited_work":{"arxiv_id":"2506.03332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helpful agent meets deceptive judge: Understanding vulnerabilities in agentic workflows","venue":null,"work_id":"7f5159e8-a0d9-4833-98a9-abb87861d7cb","year":2025},"citing_paper":{"arxiv_id":"2605.11003","last_updated":"2026-05-10T04:05:31Z","snapshot_observed_at":"2026-07-06T23:22:52.369277Z","submitted_at":"2026-05-10T04:05:31Z","title":"The Authorization-Execution Gap Is a Major Safety and Security Problem in Open-World Agents","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-05-13T01:19:48.189694Z"},"links":{"cited_paper":"/paper/2506.03332","citing_paper":"/paper/2605.11003"},"observation_digest":"sha256:99acdde5cd5eb69bfe09340ad29df087313051056edd7e495b35f115dd14a368","observation_id":"7789b71c-de9e-4cfe-a038-da6c13ecd995","resolution":{"observed_at":"2026-05-13T01:22:01.851015Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"cited_work":{"arxiv_id":"2506.03332","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03332","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Helpful agent meets deceptive judge: Understanding vulnerabilities in agentic workflows","venue":null,"work_id":"7f5159e8-a0d9-4833-98a9-abb87861d7cb","year":2025},"citing_paper":{"arxiv_id":"2605.22534","last_updated":"2026-05-21T14:24:20Z","snapshot_observed_at":"2026-07-06T23:32:49.530788Z","submitted_at":"2026-05-21T14:24:20Z","title":"Why Are Agentic Pull Requests Merged or Rejected? An Empirical Study","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-05-22T03:53:03.807297Z"},"links":{"cited_paper":"/paper/2506.03332","citing_paper":"/paper/2605.22534"},"observation_digest":"sha256:4b1560bbbc9f4b0c915f0b029907dce1a8ad5e29c60c74d932c70da430a4dbe3","observation_id":"984043c9-0be9-42eb-b35b-bf409fdce334","resolution":{"observed_at":"2026-05-22T03:54:34.006576Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"links":{"evidence":"/evidence","html":"/paper/2506.03332/citation-record","integrity":"/paper/2506.03332/integrity","json":"/paper/2506.03332/citation-record.json","paper":"/paper/2506.03332"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.968054Z","title":"ReConcile: Round-table conference improves reasoning via consensus among diverse LLMs","venue":null,"work_id":"3037374a-4725-4033-94cf-856bc53c7944","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.517449Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:54e692d206cd5a65eed1e859e55e241f90f207c0120c8772dfb150b1418215bd","observation_id":"8b8395ea-c8c5-4af7-a3da-a1ff96abb61e","resolution":{"observed_at":"2026-08-07T11:10:48.042471Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1803.05457","last_updated":"2018-03-14T18:04:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2018-03-14T18:04:21Z","title":"Think you have Solved Question Answering? Try ARC, the AI2 Reasoning Challenge","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1803.05457","snapshot_observed_at":"2026-08-07T11:10:45.521483Z","title":"Think you have solved question answering? try arc, the ai2 reasoning challenge.arXiv preprint arXiv:1803.05457, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.521483Z"},"links":{"cited_paper":"/paper/1803.05457","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:db3cbc5f6eb2402c9b2e8b0a5f70221276612eb0affa0e772b5f754b5f6288d4","observation_id":"1361cfdc-fabe-4716-b7f6-8fefba645e89","resolution":{"observed_at":"2026-08-07T11:10:45.521483Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.794568Z","title":"Synthetic disinformation attacks on automated fact verification systems","venue":null,"work_id":"5deee2bb-ef18-4388-8d21-c0d2ad506ac8","year":2022},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.524917Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:f5f297b2ecbca43ad18ba2767ca85400a49aa9b43d6b263fb531c1a807d7bbd8","observation_id":"1676adec-811d-4096-b08f-16bcf22e89b1","resolution":{"observed_at":"2026-08-07T11:10:47.859384Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.14325","last_updated":"2023-05-23T17:55:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-05-23T17:55:11Z","title":"Improving Factuality and Reasoning in Language Models through Multiagent Debate","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.14325","snapshot_observed_at":"2026-08-07T11:10:45.528343Z","title":"Improv- ing factuality and reasoning in language models through multiagent debate.arXiv preprint arXiv:2305.14325, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.528343Z"},"links":{"cited_paper":"/paper/2305.14325","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c80ed4061a9d95656b2eb3de736d7faeae4071f1979d2a8ab45e66fd2f096e53","observation_id":"b8f5c337-7361-4ea6-bcfd-9825eb220d40","resolution":{"observed_at":"2026-08-07T11:10:45.528343Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1903.00161","last_updated":"2019-04-16T21:22:39Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2019-03-01T05:32:01Z","title":"DROP: A Reading Comprehension Benchmark Requiring Discrete Reasoning Over Paragraphs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1903.00161","snapshot_observed_at":"2026-08-07T11:10:45.531959Z","title":"Drop: A reading comprehension benchmark requiring discrete reasoning over paragraphs","venue":null,"work_id":null,"year":1903},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.531959Z"},"links":{"cited_paper":"/paper/1903.00161","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:3350d13b8b35ffa0a0cb39ad1d3400ecade2512be3ad5f5e2bc130fec4d970c1","observation_id":"3aba0d3b-023e-48d5-8fb5-9a0f63d0116c","resolution":{"observed_at":"2026-08-07T11:10:45.531959Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1704.05179","last_updated":"2017-06-11T11:51:06Z","snapshot_observed_at":"2026-08-01T17:16:13.609906Z","submitted_at":"2017-04-18T02:42:17Z","title":"SearchQA: A New Q&A Dataset Augmented with Context from a Search Engine","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1704.05179","snapshot_observed_at":"2026-08-07T11:10:45.536054Z","title":"Searchqa: A new q&a dataset augmented with context from a search engine.arXiv preprint arXiv:1704.05179, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.536054Z"},"links":{"cited_paper":"/paper/1704.05179","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6fe8d73c57431dcece6eb7017f015c4b36abdfa0f03fb5deadcef4e5f2f31b05","observation_id":"f9c8f781-43ed-4575-98e9-6d9d5f450882","resolution":{"observed_at":"2026-08-07T11:10:45.536054Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2303.04910","last_updated":"2023-03-16T01:09:08Z","snapshot_observed_at":"2026-08-05T15:17:11.739277Z","submitted_at":"2023-03-08T22:00:15Z","title":"Baldur: Whole-Proof Generation and Repair with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.04910","snapshot_observed_at":"2026-08-07T11:10:45.540047Z","title":"Rabe, Talia Ringer, and Yuriy Brun","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.540047Z"},"links":{"cited_paper":"/paper/2303.04910","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c6b916e64ade8a9b8bb1b78b44492a3bc9430360295e7f4ed3f4637416d8fd01","observation_id":"c46706d3-b975-4a89-9062-bb9564179cb3","resolution":{"observed_at":"2026-08-07T11:10:45.540047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.11738","last_updated":"2024-02-21T12:59:21Z","snapshot_observed_at":"2026-07-31T18:12:14.483728Z","submitted_at":"2023-05-19T15:19:44Z","title":"CRITIC: Large Language Models Can Self-Correct with Tool-Interactive Critiquing","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.11738","snapshot_observed_at":"2026-08-07T11:10:45.544006Z","title":"CRITIC: Large language models can self-correct with tool-interactive critiquing","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.544006Z"},"links":{"cited_paper":"/paper/2305.11738","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6c4439e53a63a34f3382389aa5c0b32debfbcb9edaff531d104c01c2766cc1dd","observation_id":"a53f184f-325a-4c2d-87ab-0386c753d6f8","resolution":{"observed_at":"2026-08-07T11:10:45.544006Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.647691Z","title":"The larger the better? improved LLM code-generation via budget reallocation","venue":null,"work_id":"223b6017-cb92-4413-92c8-fa2fd25570fc","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.547462Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:747787dfe5521b682be6afee93cfb17d4f638fc60767ceba16d55c2628607f07","observation_id":"014c86a3-04a1-4df9-b5b7-e1cb9428fb57","resolution":{"observed_at":"2026-08-07T11:10:47.713786Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2009.03300","last_updated":"2021-01-12T18:57:11Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2020-09-07T17:59:25Z","title":"Measuring Massive Multitask Language Understanding","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2009.03300","snapshot_observed_at":"2026-08-07T11:10:45.550880Z","title":"Measuring massive multitask language understanding.arXiv preprint arXiv:2009.03300, 2020","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.550880Z"},"links":{"cited_paper":"/paper/2009.03300","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:1b3b2819ae2e3a59cd4c33c8d2e4dba8dd623631cacad8b7d11165c350a951c4","observation_id":"29a76a2f-4925-44d7-8582-e6a5c9d92acb","resolution":{"observed_at":"2026-08-07T11:10:45.550880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01798","last_updated":"2024-03-14T04:27:52Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-10-03T04:56:12Z","title":"Large Language Models Cannot Self-Correct Reasoning Yet","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.01798","snapshot_observed_at":"2026-08-07T11:10:45.554308Z","title":"Large language models cannot self-correct reasoning yet.arXiv preprint arXiv:2310.01798, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.554308Z"},"links":{"cited_paper":"/paper/2310.01798","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:82b6e61082644899ea79133375d82b9e3342706f4052eec11264010a98d36157","observation_id":"424f8645-1142-4952-b467-92cd4ba4e026","resolution":{"observed_at":"2026-08-07T11:10:45.554308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-08-07T11:10:45.557635Z","title":"Gpt-4o system card.arXiv preprint arXiv:2410.21276, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.557635Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:475f1727b22bceb8295abd80445888007bc15573b36ed5f109308e57590aa544","observation_id":"9e438a02-8bcd-42db-ad95-d3711708e956","resolution":{"observed_at":"2026-08-07T11:10:45.557635Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-08-07T11:10:45.561129Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.561129Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:2f889b68e49f963491297842fd9e60652ac2a26190efe20c06b8e576d5024a46","observation_id":"369e756e-bf62-4a64-828a-cc97e895e1f9","resolution":{"observed_at":"2026-08-07T11:10:45.561129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1705.03551","last_updated":"2017-05-13T21:12:37Z","snapshot_observed_at":"2026-08-02T11:13:42.401488Z","submitted_at":"2017-05-09T21:35:07Z","title":"TriviaQA: A Large Scale Distantly Supervised Challenge Dataset for Reading Comprehension","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1705.03551","snapshot_observed_at":"2026-08-07T11:10:45.564319Z","title":"Triviaqa: A large scale distantly supervised challenge dataset for reading comprehension.arXiv preprint arXiv:1705.03551, 2017","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.564319Z"},"links":{"cited_paper":"/paper/1705.03551","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:40f0d7bc7d58e44168193a8f5833a614f8582312e77d4daa404c307cfc360445","observation_id":"0d8abfcb-76f5-464c-ac2c-af43ba4c354c","resolution":{"observed_at":"2026-08-07T11:10:45.564319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.485503Z","title":"When can LLMs actually correct their own mistakes? a critical survey of self-correction of LLMs.Transactions of the Association for Computational Linguistics, 12:1417–1440, 2024","venue":null,"work_id":"a340fea1-2fa7-4442-bba4-c18cb8025d79","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.567712Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:aa8645790714cdcee607e1a446cf27203913b24fa5a1bb68f4facfb30951efb5","observation_id":"65cd85af-c690-480d-b6df-a537f449e9fd","resolution":{"observed_at":"2026-08-07T11:10:47.579967Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2407.01502","last_updated":"2024-07-01T17:48:14Z","snapshot_observed_at":"2026-08-06T22:15:08.500389Z","submitted_at":"2024-07-01T17:48:14Z","title":"AI Agents That Matter","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.01502","snapshot_observed_at":"2026-08-07T11:10:45.571170Z","title":"Siegel, Nitya Nadgir, and Arvind Narayanan","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.571170Z"},"links":{"cited_paper":"/paper/2407.01502","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c5e9868eb82879c2cd0a6260ba842253c8791dd68261c728e0289f090c53c201","observation_id":"81f7c4be-d452-422d-9d8f-d5bd2c12d249","resolution":{"observed_at":"2026-08-07T11:10:45.571170Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.271830Z","title":"Bowman, Tim Rocktäschel, and Ethan Perez","venue":null,"work_id":"29186178-5882-4705-938c-7897375c89f1","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.574364Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:1b5bc8111663c19c95f1e3cf861f11ba860f1861b25b6ec2b45dfd67d71672f3","observation_id":"ec74cd6d-d6ba-485c-be06-83020276e60d","resolution":{"observed_at":"2026-08-07T11:10:47.375433Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.577818Z","title":"Natural questions: a benchmark for question answering research.Transactions of the Association for Computational Linguistics, 7:453–466, 2019","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.577818Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:149a3c7aea8dfa1c690fb254aa6d39bd3f1dbf1b00d85499666efddc99d700e4","observation_id":"52cdb31c-8fde-43c1-9c84-baa153c6daca","resolution":{"observed_at":"2026-08-07T11:10:45.577818Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.581968Z","title":"Making language models better reasoners with step-aware verifier","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.581968Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7f5605e12277068dfa9ce91f877f6e1436dd55d2807cb4480f453d97be56df01","observation_id":"70b948cd-baec-4553-8abd-ef315209b3b4","resolution":{"observed_at":"2026-08-07T11:10:45.581968Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:47.091617Z","title":"Encouraging divergent thinking in large language models through multi- agent debate","venue":null,"work_id":"aeb97129-4f5f-4e63-aa58-1471b85535b2","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.585154Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7e83d629c84100611551fdbea3d6bf5297ad54f25d9725633096807467cf9594","observation_id":"3e3d13e9-9249-4e03-8909-d85da7e37c06","resolution":{"observed_at":"2026-08-07T11:10:47.161684Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.17651","last_updated":"2023-05-25T19:13:47Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-30T18:30:01Z","title":"Self-Refine: Iterative Refinement with Self-Feedback","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.17651","snapshot_observed_at":"2026-08-07T11:10:45.589027Z","title":"Self- Refine: Iterative refinement with self-feedback.arXiv preprint arXiv:2303.17651, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.589027Z"},"links":{"cited_paper":"/paper/2303.17651","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:1e84f220427255dcbf74a4c7e1bf4bd3e610ca94c36b7521721ed0d1f83211cb","observation_id":"b58eb157-5c5c-40ba-b168-9470b7f9814c","resolution":{"observed_at":"2026-08-07T11:10:45.589027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.08702","last_updated":"2023-11-15T05:05:40Z","snapshot_observed_at":"2026-07-06T16:47:45.504109Z","submitted_at":"2023-11-15T05:05:40Z","title":"Debate Helps Supervise Unreliable Experts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.08702","snapshot_observed_at":"2026-08-07T11:10:45.592227Z","title":"Debate helps supervise unreliable experts.arXiv preprint arXiv:2311.08702, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.592227Z"},"links":{"cited_paper":"/paper/2311.08702","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:2f9bcc6b6d3ceaa627003269c5c68ded22c6442a19a57dd96a1d3b0eabbb84d7","observation_id":"f6843d3e-326c-48dd-9049-be2657dc59ad","resolution":{"observed_at":"2026-08-07T11:10:45.592227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.926507Z","title":"Faitheval: Can your language model stay faithful to context, even if ”the moon is made of marshmallows”","venue":null,"work_id":"9b257117-ba27-4458-87b4-64e405c91c6f","year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.595523Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:ece53542cc47304781f2198f31102e167a1415a379d33a95e4631f671abc2e9b","observation_id":"b140cf55-d037-4299-a99d-98c319d50c95","resolution":{"observed_at":"2026-08-07T11:10:46.993915Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.737060Z","title":"Lever: Learning to verify language-to-code generation with execution","venue":null,"work_id":"8fcccc7e-9765-4420-bc06-9c6b29b151d8","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.598687Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7d736572a3dbcbbd157dca0dd6710d996769e79f7878b2bd3dfde39b80ae34de","observation_id":"0e540f63-cb26-4645-bd04-120ec0f23f93","resolution":{"observed_at":"2026-08-07T11:10:46.847888Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2305.13661","last_updated":"2023-10-26T20:45:39Z","snapshot_observed_at":"2026-07-06T15:31:05.250637Z","submitted_at":"2023-05-23T04:10:26Z","title":"On the Risk of Misinformation Pollution with Large Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.13661","snapshot_observed_at":"2026-08-07T11:10:45.601797Z","title":"On the risk of misinformation pollution with large language models.arXiv preprint arXiv:2305.13661, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.601797Z"},"links":{"cited_paper":"/paper/2305.13661","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:3d4ec4229f7fdaac6f001b37e7227b62d036784b4d535212d797b3332a4c2761","observation_id":"a94a1d61-8e0d-470a-8a80-68e877edd8e6","resolution":{"observed_at":"2026-08-07T11:10:45.601797Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.06551","last_updated":"2024-10-07T08:49:49Z","snapshot_observed_at":"2026-08-06T11:46:01.178597Z","submitted_at":"2024-07-09T05:16:22Z","title":"OffsetBias: Leveraging Debiased Data for Tuning Evaluators","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.06551","snapshot_observed_at":"2026-08-07T11:10:45.605360Z","title":"Offsetbias: Leveraging debiased data for tuning evaluators.arXiv preprint arXiv:2407.06551, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.605360Z"},"links":{"cited_paper":"/paper/2407.06551","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7b89beff9162a469441aa83f03c6f0398c63cfa3d1f3ece2dace5d9b26552ba1","observation_id":"56114032-d189-4cae-8ef5-06c0cdd39060","resolution":{"observed_at":"2026-08-07T11:10:45.605360Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.588711Z","title":"Bowman, Amanda Askell, Roger Grosse, Danny Hernandez, Deep Ganguli, Evan Hubinger, Nicholas Schiefer, and Jared Kaplan","venue":null,"work_id":"f069e13a-0c10-4774-b7c0-4cf3ecb8d6bb","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.608726Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:0cd44781485a495c9ff1f55699ab141e4957da7bd64c328e3efa5e4ebad4e07f","observation_id":"8c3f49e0-dbb3-4f3a-828b-3ad7cfbcd84d","resolution":{"observed_at":"2026-08-07T11:10:46.671505Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.611812Z","title":"Gpqa: A graduate-level google-proof q&a benchmark","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.611812Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:c42c6d7a074010a323223ae875ddd8fa717649f80e118454e407e2c52198301d","observation_id":"a25700a9-0615-4de9-a465-29cc43230d9a","resolution":{"observed_at":"2026-08-07T11:10:45.611812Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.15254","last_updated":"2025-06-10T21:52:15Z","snapshot_observed_at":"2026-07-06T19:20:37.430389Z","submitted_at":"2024-09-23T17:53:42Z","title":"Archon: An Architecture Search Framework for Inference-Time Techniques","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.15254","snapshot_observed_at":"2026-08-07T11:10:45.615625Z","title":"Kelly Buchanan, Mayee Chen, Neel Guha, Christopher Ré, and Azalia Mirho- seini","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.615625Z"},"links":{"cited_paper":"/paper/2409.15254","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:839d6bfaf8a796220c2c7098f9c5ec574aaa7f6f6ff13b6014d128a83ecf12e6","observation_id":"f78f1aca-f91e-42a5-b10a-e3c0dfaf3c88","resolution":{"observed_at":"2026-08-07T11:10:45.615625Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.618993Z","title":"Winogrande: An adversarial winograd schema challenge at scale.Communications of the ACM, 64(9):99–106, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.618993Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:38357fceb083a4df122046a0abd4b729afd7f8f1c16ca13c5a2fa8c913ab14be","observation_id":"78054db9-5947-4319-9573-31d6d4e47596","resolution":{"observed_at":"2026-08-07T11:10:45.618993Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10690","last_updated":"2025-03-12T01:53:49Z","snapshot_observed_at":"2026-08-07T17:11:24.636409Z","submitted_at":"2025-03-12T01:53:49Z","title":"Battling Misinformation: An Empirical Study on Adversarial Factuality in Open-Source Large Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10690","snapshot_observed_at":"2026-08-07T11:10:45.622334Z","title":"Battling misinformation: An empirical study on adversarial factuality in open-source large language models.arXiv preprint arXiv:2503.10690, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.622334Z"},"links":{"cited_paper":"/paper/2503.10690","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:dff2851b0085c244e0e341da3645ef82defde5e22d9043bc8d7131af35a51576","observation_id":"41c39a13-2c28-46cd-89d4-ccd9cc75da88","resolution":{"observed_at":"2026-08-07T11:10:45.622334Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.545480Z","title":null,"venue":null,"work_id":"f5065887-abd8-43fb-90d5-c4aaeef116ea","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.625638Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:d1cd9775be1327672f48a3bea04ab6b1a3c6e51eeb4a1661982ffadcc67941c7","observation_id":"31e67fda-94ee-45ba-bbfe-e651cdfd53fb","resolution":{"observed_at":"2026-08-07T11:10:46.553778Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.524729Z","title":"Practices for governing agentic ai systems.Research Paper, OpenAI, December, 2023","venue":null,"work_id":"b9678670-3bb3-4942-a6bb-edd4d12825c3","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.628595Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:cf669d1718199a506f8897d5603846dbcb9b7abdbc5ce17273339c7fb25c404a","observation_id":"842dfd1d-5e0f-46ac-b200-c9efd47354d8","resolution":{"observed_at":"2026-08-07T11:10:46.535097Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2303.11366","last_updated":"2023-10-10T05:21:45Z","snapshot_observed_at":"2026-07-06T15:05:53.556198Z","submitted_at":"2023-03-20T18:08:50Z","title":"Reflexion: Language Agents with Verbal Reinforcement Learning","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2303.11366","snapshot_observed_at":"2026-08-07T11:10:45.632368Z","title":"Reflexion: Language agents with verbal reinforcement learning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.632368Z"},"links":{"cited_paper":"/paper/2303.11366","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:bc61eb4821e2b95dfb6743d3a280e3ccaf6bd2b34a3cf0ee178da7d1cfbb8271","observation_id":"5e5cffbc-a1a3-4d63-a9b6-61944c43f564","resolution":{"observed_at":"2026-08-07T11:10:45.632368Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.636111Z","title":"Inference scaling flaws: The limits of llm resampling with imperfect verifiers.arXiv preprint arXiv:2411.17501, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.636111Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:d748235916766868cde455e0cf420f3c9efe5e19b77b939d7d7a02f24f762772","observation_id":"e7aa50e3-d305-4872-9050-3b414728ed19","resolution":{"observed_at":"2026-08-07T11:10:45.636111Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19786","last_updated":"2025-03-25T15:52:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-25T15:52:34Z","title":"Gemma 3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19786","snapshot_observed_at":"2026-08-07T11:10:45.639268Z","title":"Gemma 3 technical report.arXiv preprint arXiv:2503.19786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.639268Z"},"links":{"cited_paper":"/paper/2503.19786","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b630999ea20d15bc436473a5dc8bd00851feb321b7c2243c5b11d3f602d9f1e5","observation_id":"659746c9-1a21-40c3-9810-e03b8f945461","resolution":{"observed_at":"2026-08-07T11:10:45.639268Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.504529Z","title":"An in- context learning agent for formal theorem-proving","venue":null,"work_id":"2da8fd00-ecaf-4b73-8be5-f07498672826","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.643196Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:4c4f3e7e6d4f59da41a37e182e45be267b270fcb4c82d05b254ed63bacf0126f","observation_id":"9b1b878d-ba31-4c7f-bde1-3703747c52e4","resolution":{"observed_at":"2026-08-07T11:10:46.513148Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.19855","last_updated":"2025-03-25T17:19:38Z","snapshot_observed_at":"2026-08-07T16:37:44.743882Z","submitted_at":"2025-03-25T17:19:38Z","title":"Think Twice: Enhancing LLM Reasoning by Scaling Multi-round Test-time Thinking","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.19855","snapshot_observed_at":"2026-08-07T11:10:45.650713Z","title":"Think twice: Enhancing llm reasoning by scaling multi-round test-time thinking.arXiv preprint arXiv:2503.19855, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.650713Z"},"links":{"cited_paper":"/paper/2503.19855","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a880e97662dae0815a79a69464a99a7ef94d9c32f81f6eaad16839ec6cf4ca37","observation_id":"2c8095f3-cbcc-4b22-9706-b030bf3a72e6","resolution":{"observed_at":"2026-08-07T11:10:45.650713Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.654664Z","title":"Toward self-improvement of llms via imagination, searching, and criticizing.Advances in Neural Information Processing Systems, 37:52723–52748, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.654664Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:cd43a5a9d7f2df8831afa7d0f8a1f8dcfb6042da2541ec0a7dd7150338f2921e","observation_id":"df1619c1-a459-40f1-b5a0-6510583c4d5c","resolution":{"observed_at":"2026-08-07T11:10:45.654664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1611.09830","last_updated":"2017-02-07T16:27:59Z","snapshot_observed_at":"2026-07-06T05:20:37.916333Z","submitted_at":"2016-11-29T20:38:07Z","title":"NewsQA: A Machine Comprehension Dataset","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1611.09830","snapshot_observed_at":"2026-08-07T11:10:45.657768Z","title":"Newsqa: A machine comprehension dataset.arXiv preprint arXiv:1611.09830, 2016","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.657768Z"},"links":{"cited_paper":"/paper/1611.09830","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:e5ac2f6985bf3f49c349d955580e59b77719e399e19d52c328763535122b2ccd","observation_id":"ca280cb7-08fe-4757-b276-fb36c5ca5541","resolution":{"observed_at":"2026-08-07T11:10:45.657768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.445717Z","title":"LEGO-prover: Neural theorem proving with growing libraries","venue":null,"work_id":"5f846c7f-e9a2-44a2-8023-f1ed92f370e6","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.661889Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:9746cda57b4f439260dc5391cc54d35a59adf9160a6c8ec1d45430234bb5e728","observation_id":"02705d8d-9e81-4e3e-a8e6-e51996d1acca","resolution":{"observed_at":"2026-08-07T11:10:46.462307Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.00935","last_updated":"2024-10-15T05:23:56Z","snapshot_observed_at":"2026-08-06T03:31:46.603231Z","submitted_at":"2023-10-02T06:57:45Z","title":"Resolving Knowledge Conflicts in Large Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.00935","snapshot_observed_at":"2026-08-07T11:10:45.665136Z","title":"Resolving knowledge conflicts in large language models.arXiv preprint arXiv:2310.00935, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.665136Z"},"links":{"cited_paper":"/paper/2310.00935","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:133dab4d4537685307d2d0ce34b832533da73923a41d094ff2bec37c9984d0da","observation_id":"304c27ca-984c-4766-aaad-e5d1b58d3881","resolution":{"observed_at":"2026-08-07T11:10:45.665136Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2411.04368","last_updated":"2024-11-07T01:58:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-11-07T01:58:42Z","title":"Measuring short-form factuality in large language models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2411.04368","snapshot_observed_at":"2026-08-07T11:10:45.669134Z","title":"Measuring short-form factuality in large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.669134Z"},"links":{"cited_paper":"/paper/2411.04368","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:669e286234e2690331acdf13961941cdb31fba8c1a050dad3d9c8175d17d4604","observation_id":"ce2080a2-9371-4e44-8d81-267562a7ef10","resolution":{"observed_at":"2026-08-07T11:10:45.669134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.03958","last_updated":"2024-02-15T01:03:13Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-07T23:48:36Z","title":"Simple synthetic data reduces sycophancy in large language models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.03958","snapshot_observed_at":"2026-08-07T11:10:45.672950Z","title":"Simple synthetic data reduces sycophancy in large language models.arXiv preprint arXiv:2308.03958, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.672950Z"},"links":{"cited_paper":"/paper/2308.03958","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:8bac6fb6b6ee9acc4642b5206f661d832720d9ba498b7cec69e0429537b6c417","observation_id":"8160064c-d682-4a19-81db-c13f2bdcfb9e","resolution":{"observed_at":"2026-08-07T11:10:45.672950Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.404313Z","title":"Examining inter-consistency of large language models collaboration: An in-depth analysis via debate","venue":null,"work_id":"a6fa6c64-49be-46bc-bf00-08bf4f347fc7","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.676470Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:d31f17a1c0b3fd8db8b2f4f76516752aeed3d8c72cdffcc497ec2779b8256bb7","observation_id":"257dc43e-dd17-4bd5-a5ea-9a73874ed609","resolution":{"observed_at":"2026-08-07T11:10:46.422874Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2503.15620","last_updated":"2025-03-19T18:09:19Z","snapshot_observed_at":"2026-08-07T16:50:53.978207Z","submitted_at":"2025-03-19T18:09:19Z","title":"Does Context Matter? ContextualJudgeBench for Evaluating LLM-based Judges in Contextual Settings","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.15620","snapshot_observed_at":"2026-08-07T11:10:45.679960Z","title":"Does context matter? contextualjudgebench for evaluating llm-based judges in contextual settings, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.679960Z"},"links":{"cited_paper":"/paper/2503.15620","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:58afdf39d2d046fad7abdcedd4a1ef95d6c280941b428b8093e0c682cd18561b","observation_id":"3503e66b-4cd2-435a-bd88-7619c505b8ca","resolution":{"observed_at":"2026-08-07T11:10:45.679960Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.09085","last_updated":"2024-05-31T15:13:33Z","snapshot_observed_at":"2026-07-06T17:01:49.058644Z","submitted_at":"2023-12-14T16:16:50Z","title":"The Earth is Flat because...: Investigating LLMs' Belief towards Misinformation via Persuasive Conversation","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.09085","snapshot_observed_at":"2026-08-07T11:10:45.684166Z","title":"The earth is flat because...: Investigating llms’ belief towards misinformation via persuasive conversation.arXiv preprint arXiv:2312.09085, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.684166Z"},"links":{"cited_paper":"/paper/2312.09085","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:5e707fc9af407f96886b67c7df20ec315e30ef0f09dc429aea5c26cf2d9e8bf1","observation_id":"58d5fa96-f9fb-404b-884f-7bb3d5894e24","resolution":{"observed_at":"2026-08-07T11:10:45.684166Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.08319","last_updated":"2024-06-22T08:31:40Z","snapshot_observed_at":"2026-08-04T21:59:01.328432Z","submitted_at":"2024-03-13T08:02:23Z","title":"Knowledge Conflicts for LLMs: A Survey","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.08319","snapshot_observed_at":"2026-08-07T11:10:45.688349Z","title":"Knowledge conflicts for llms: A survey.arXiv preprint arXiv:2403.08319, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.688349Z"},"links":{"cited_paper":"/paper/2403.08319","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:39ba80c1fdd44b333c43b2f2c046406f7cac9539b92b3832c46d93f999a86f57","observation_id":"2452f366-8686-4d5c-acce-2afacc8d01fa","resolution":{"observed_at":"2026-08-07T11:10:45.688349Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.15115","last_updated":"2025-01-03T02:18:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-19T17:56:09Z","title":"Qwen2.5 Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.15115","snapshot_observed_at":"2026-08-07T11:10:45.691942Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.691942Z"},"links":{"cited_paper":"/paper/2412.15115","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:8f1d8678d32d0369341a4305ce7e4da353770d4da07c27f60727b55b3206ea58","observation_id":"03d51244-6295-4ae4-a1b1-348b5a65cd5e","resolution":{"observed_at":"2026-08-07T11:10:45.691942Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2205.12443","last_updated":"2022-10-21T20:08:11Z","snapshot_observed_at":"2026-07-06T13:13:37.143547Z","submitted_at":"2022-05-25T02:22:30Z","title":"Generating Natural Language Proofs with Verifier-Guided Search","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2205.12443","snapshot_observed_at":"2026-08-07T11:10:45.695856Z","title":"Generating natural language proofs with verifier-guided search.arXiv preprint arXiv:2205.12443, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.695856Z"},"links":{"cited_paper":"/paper/2205.12443","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6dbe91c131b1a3cdc400de3851f3d34635c8cd576cb89c42e205928a45611bc5","observation_id":"2c4865fa-1973-4da3-a5e3-4519ccad2170","resolution":{"observed_at":"2026-08-07T11:10:45.695856Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1809.09600","last_updated":"2018-09-25T17:28:20Z","snapshot_observed_at":"2026-07-31T11:19:06.421362Z","submitted_at":"2018-09-25T17:28:20Z","title":"HotpotQA: A Dataset for Diverse, Explainable Multi-hop Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1809.09600","snapshot_observed_at":"2026-08-07T11:10:45.699426Z","title":"Hotpotqa: A dataset for diverse, explainable multi-hop question answering.arXiv preprint arXiv:1809.09600, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.699426Z"},"links":{"cited_paper":"/paper/1809.09600","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a6a059309c730230bac116d678110abc364a8e81df4f1825a005b73d4b47cc62","observation_id":"4df5328b-2433-4d1d-b33b-c9d76a162aa4","resolution":{"observed_at":"2026-08-07T11:10:45.699426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.377114Z","title":"LLMCrit: Teaching large language models to use criteria","venue":null,"work_id":"c43c081f-7b8f-42f6-a83e-9c0284d2d037","year":2024},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.702959Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b61410caab7f23fd9d7100095f21a9337b5a8040247e5a339f6a448e2c1591ed","observation_id":"ee76ef9b-3d3e-4419-8144-19406373b589","resolution":{"observed_at":"2026-08-07T11:10:46.383357Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.706946Z","title":"AFlow: Automating agentic workflow generation","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.706946Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7f4adcf2b1d1aee8ef674fea4a8c0ef03f6ed951fd7fb88dec9890858b6f3377","observation_id":"85143046-42f5-45bf-a161-4eab3dea9688","resolution":{"observed_at":"2026-08-07T11:10:45.706946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:45.710982Z","title":"SituatedQA: Incorporating extra-linguistic contexts into QA","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.710982Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:abd68ebae336dae5c880fd651f02fc28ad5cb97c960b5ee2a2c65498ad1e3654","observation_id":"83e44c2b-a4f8-483e-92bb-2e3918ca5c43","resolution":{"observed_at":"2026-08-07T11:10:45.710982Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.361400Z","title":"Position- aware attention and supervised data improve slot filling","venue":null,"work_id":"524137d5-b041-4a50-9d21-2ed04f6e09c8","year":2017},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.714283Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:cc68c3e1bce6435a21057d8bbc33ddb56fbac286472ba90d83a1bdb052f4764d","observation_id":"7036bc86-9c64-44ad-9f76-3a3870d4ac62","resolution":{"observed_at":"2026-08-07T11:10:46.364770Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.14393","last_updated":"2023-10-22T19:37:06Z","snapshot_observed_at":"2026-07-06T16:36:47.091524Z","submitted_at":"2023-10-22T19:37:06Z","title":"Merging Generated and Retrieved Knowledge for Open-Domain QA","version":1},"cited_work":{"arxiv_id":"2310.14393","doi":null,"metadata_source":"pith","pith_arxiv_id":"2310.14393","snapshot_observed_at":"2026-08-07T11:10:45.805440Z","title":"Merging Generated and Retrieved Knowledge for Open-Domain QA","venue":"cs.CL","work_id":"42bc34c1-815e-4454-bdc2-58171192511d","year":2023},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.717582Z"},"links":{"cited_paper":"/paper/2310.14393","citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:397e2c0f37c2afacae99957b7b646db56fec04cf78499dc85da3dbebcdc1bae4","observation_id":"9dc70918-abe1-4e64-99f7-dbe0d6ade062","resolution":{"observed_at":"2026-08-07T11:10:45.811721Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.352275Z","title":null,"venue":null,"work_id":"712347ec-c0e5-4c9f-915f-8d19b1a14369","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.722403Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:193f4344e67ccca60f523b380a84804cdb09dffa60ad0e83174b94d7db2edd47","observation_id":"fb463a37-ff55-4bdb-8faa-15fda3878e57","resolution":{"observed_at":"2026-08-07T11:10:46.355427Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.343025Z","title":null,"venue":null,"work_id":"c98e92c7-0295-4d20-8ec7-7bb395e3179c","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.725664Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:fd37af466920c939f79e9d12b7f944ce4e675af559859b0769fdd60461684a76","observation_id":"ee76e201-3308-4478-ad17-b3b5c3a75b4e","resolution":{"observed_at":"2026-08-07T11:10:46.346548Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.333018Z","title":"studies” or “statistics","venue":null,"work_id":"8858d8e9-9983-4e8a-b986-6c0738fc40eb","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.729976Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:023654293c595d548ee95cc26588e3eddedc3c8d18cad66efd45e6996c849770","observation_id":"572d83ec-8ba1-4651-90bf-354c801e2a6b","resolution":{"observed_at":"2026-08-07T11:10:46.336953Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.323201Z","title":null,"venue":null,"work_id":"342b4afd-4a4a-48aa-b650-1c2193a084b3","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.734594Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:5bddecf3bfcbb1733cc48710b91690626f037dd02cabb41ad210b1f5fcafd04b","observation_id":"035fbc01-6134-4025-922f-234761dc69a8","resolution":{"observed_at":"2026-08-07T11:10:46.326832Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.313292Z","title":"expert opinions","venue":null,"work_id":"208ad94a-bfed-4d97-bab6-e97d68b2c16f","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.738482Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7b74e07a4ca6ecf8f8dc241129b2b39e27eb150ce3c35e44805c98ac3c9ea7e1","observation_id":"4d7d511f-fe48-42b9-b46d-cb6b044086aa","resolution":{"observed_at":"2026-08-07T11:10:46.316400Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.303718Z","title":null,"venue":null,"work_id":"0d8bb175-15b4-424b-a82c-aa7296643a64","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.741757Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:7759966a3c0e753c25724d6b3893c1fe128d2b8a5a2364fd94415042c64e8c17","observation_id":"10b453a9-9b0f-49ce-820a-680c620ab5b3","resolution":{"observed_at":"2026-08-07T11:10:46.307058Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.293968Z","title":null,"venue":null,"work_id":"f983d23a-deab-4589-8de1-4c70dfeab31e","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.745532Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:817d8f29b68d673a9726539c2a2dfb02f104f0fd8ac53cf2685aa8c1f37570fa","observation_id":"876b9632-643b-4d15-9a95-236dea98d87f","resolution":{"observed_at":"2026-08-07T11:10:46.297727Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.284369Z","title":null,"venue":null,"work_id":"72ef313b-3dd0-4787-8b4b-4188cc031084","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.749904Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:b41d556d267058c758decbe2f4a30a9fc29de2f99983d9932a3ffd644014d9b8","observation_id":"abeea410-1d77-4113-921e-e055787fb5c6","resolution":{"observed_at":"2026-08-07T11:10:46.287737Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.273313Z","title":"Be creative and ruthless in your criticism","venue":null,"work_id":"fa4e1567-dc48-4bcd-b71f-6f27fb68eb75","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.753651Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:466518b549f6f2aab86eb15a65ca466aefd4d00fb7b59bcfcce070a6b0352e3c","observation_id":"9e052475-cf78-4112-8276-42ded6e7cda6","resolution":{"observed_at":"2026-08-07T11:10:46.277779Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.262970Z","title":"Are you sure about this? I don’t think this answer is correct because","venue":null,"work_id":"08306005-cf91-4dbd-876b-730385ed3fbb","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.756990Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:6f8648cbb8d03b531379412f3f0e978adf1b7a7d85333b225aaac0f1791430ea","observation_id":"a6288341-3502-4487-97de-6f57e5dd6779","resolution":{"observed_at":"2026-08-07T11:10:46.266954Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.252069Z","title":"This conclusion seems hasty. What if","venue":null,"work_id":"024ad17f-35ae-4934-a9aa-a5db25432503","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.760176Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:4a275ccbd95462860650a8c00fa13508b68e02f920042bdb79ceb7c72e5ddc5f","observation_id":"a240727e-2006-44d5-9ecd-1242c28fe83e","resolution":{"observed_at":"2026-08-07T11:10:46.256950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.241616Z","title":"I don’t think this follows logically because","venue":null,"work_id":"e6067b22-e92d-4edb-9f4e-96ca1b5e8d6d","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.763239Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:17345deaf53d04746bc0804e6d363d36a5dcb46665168bfe3525ce89fb02c902","observation_id":"bffffb8b-2a6b-4d8d-a43b-f864042d6cca","resolution":{"observed_at":"2026-08-07T11:10:46.245063Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.231708Z","title":null,"venue":null,"work_id":"210e3a12-fc37-4146-b60a-7f825cbc044f","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.767347Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:a7f29298e25d2036525d178b006ed291a07ac2f60bb59970cfac3c3ebefdaced","observation_id":"5eb77fa0-ba39-4b9c-a33d-d088f8b89736","resolution":{"observed_at":"2026-08-07T11:10:46.235130Z","resolver_source":"raw_fallback","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T11:10:46.484253Z","title":null,"venue":null,"work_id":"4669eeee-6185-4c1d-80ad-3d54bea85d73","year":null},"citing_paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows","version":1},"reference_index":2024,"source":"pdf_text","source_observed_at":"2026-08-07T11:10:45.647597Z"},"links":{"citing_paper":"/paper/2506.03332"},"observation_digest":"sha256:132c118de556a78a3214f0c9bba6147dd86661134f6276aeb73a2537f88ec63b","observation_id":"8e63d4c5-bcba-478c-b046-9e21234a13b8","resolution":{"observed_at":"2026-08-07T11:10:46.492842Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.03332","last_updated":"2025-06-03T19:26:23Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-07T11:03:26.433661Z","submitted_at":"2025-06-03T19:26:23Z","title":"Helpful Agent Meets Deceptive Judge: Understanding Vulnerabilities in Agentic Workflows"},"reference_resolution":{"displayed":70,"state_counts":{"malformed_identifier":1,"metadata_mismatch":1,"parse_uncertain":0,"unresolved":47,"verified_exact":0,"verified_fuzzy":21},"total_outbound_references":70},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 70 of 70 outbound references and 2 inbound Pith citation observations for arXiv:2506.03332."}