{"as_of":"2026-08-02T02:55:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:7dff9a9c4455b27d0f0fb831e05e7d2f102c12d92683d2f6aa6ecd6baa9e4766","coverage":[{"denominator":57,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":57,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-02T02:44:17.432243Z","state":"measured"},{"denominator":57,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":57,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-01T06:32:01.292127+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.14256/citation-record","integrity":"/paper/2607.14256/integrity","json":"/paper/2607.14256/citation-record.json","paper":"/paper/2607.14256"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2603.29403","last_updated":"2026-04-06T09:33:13Z","snapshot_observed_at":"2026-07-06T22:51:13.690351Z","submitted_at":"2026-03-31T08:05:54Z","title":"Security in LLM-as-a-Judge: A Comprehensive SoK","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.29403","snapshot_observed_at":"2026-08-02T02:44:13.210092Z","title":"Security in llm-as-a-judge: A comprehensive sok.arXiv preprint arXiv:2603.29403, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.210092Z"},"links":{"cited_paper":"/paper/2603.29403","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:e751b0ece5fcbf6ed27858ecf5aeb0b23651f4f8193cb129146f66f91573fe03","observation_id":"52876c55-4ea9-4615-bc02-c38753137410","resolution":{"observed_at":"2026-08-02T02:44:13.210092Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.302235Z","title":"Reference-guided verdict: Llms-as-judges in automatic evaluation of free-form qa","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.302235Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:d75267aa354fd33edfc5b87f6f6e62e8b562e0c6331ac766ad3a0e04b3a382c6","observation_id":"58511f56-6fb5-48e6-81c5-87a22d890e21","resolution":{"observed_at":"2026-08-02T02:44:13.302235Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12371","last_updated":"2026-04-15T02:42:08Z","snapshot_observed_at":"2026-07-06T23:00:37.144068Z","submitted_at":"2026-04-14T06:59:27Z","title":"Reading Between the Pixels: Linking Text-Image Embedding Alignment to Typographic Attack Success on Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12371","snapshot_observed_at":"2026-08-02T02:44:13.401198Z","title":"Reading between the pixels: Linking text-image embedding alignment to typographic attack success on vision-language models.arXiv preprint arXiv:2604.12371, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.401198Z"},"links":{"cited_paper":"/paper/2604.12371","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:307cb31d5a50c54caaaf7c8d7fb549c54a85a07c96bc82ad465c19ea14f4d5cd","observation_id":"25ec6ad5-7450-430d-8bc1-36f5a9a20c14","resolution":{"observed_at":"2026-08-02T02:44:13.401198Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.549266Z","title":"Rethinking fine- tuning when scaling test-time compute: Limiting confidence improves mathematical reasoning","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.549266Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:46858f2f7c29015fb6b14511fd953ae1c86c7eedd23a0fa70e8fc64ab55fc6a7","observation_id":"7c0bc200-52d7-411b-b170-f737ba754229","resolution":{"observed_at":"2026-08-02T02:44:13.549266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.12616","last_updated":"2026-04-14T11:44:59Z","snapshot_observed_at":"2026-07-06T23:00:46.620106Z","submitted_at":"2026-04-14T11:44:59Z","title":"Every Picture Tells a Dangerous Story: Memory-Augmented Multi-Agent Jailbreak Attacks on VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.12616","snapshot_observed_at":"2026-08-02T02:44:13.644542Z","title":"Every picture tells a dangerous story: Memory-augmented multi-agent jailbreak attacks on vlms.arXiv preprint arXiv:2604.12616, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.644542Z"},"links":{"cited_paper":"/paper/2604.12616","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:550ac03c618e1a707140effb36da732dce21117943d40e88351c7677ef8f9dc7","observation_id":"d430814e-b2b2-4e82-9c3d-bf34a6ec2e5f","resolution":{"observed_at":"2026-08-02T02:44:13.644542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.742784Z","title":"The side effects of being smart: Safety risks in mllms’ multi-image reasoning.arXiv preprint arXiv:2601.14127, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.742784Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:e2aa2743bbdf483116cee36dc7bae5d2dec4a230df0cf9d3de1a2e6baafa876c","observation_id":"4697ea5a-7ce8-48f8-a8cb-ac68ac45c49e","resolution":{"observed_at":"2026-08-02T02:44:13.742784Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12710","last_updated":"2026-05-18T06:50:41Z","snapshot_observed_at":"2026-07-06T22:35:55.936840Z","submitted_at":"2025-11-16T17:52:07Z","title":"Evolve the Method, Not the Prompts: Evolutionary Synthesis of Jailbreak Attacks on LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.12710","snapshot_observed_at":"2026-08-02T02:44:13.880726Z","title":"Evolve the method, not the prompts: Evolutionary synthesis of jailbreak attacks on llms.arXiv preprint arXiv:2511.12710, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.880726Z"},"links":{"cited_paper":"/paper/2511.12710","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:0cbbe116b51ce31eab2c9c91e2cb5c103145734b5f53271ae39cb849072dfbc3","observation_id":"9550f4db-fcb5-44ca-aa70-6971f60b464a","resolution":{"observed_at":"2026-08-02T02:44:13.880726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:13.955654Z","title":"Jailbreaking llms & vlms: Mechanisms, evaluation, and unified defense.arXiv preprint arXiv:2601.03594, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:13.955654Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:51e3e3108a1b2e5c293f0ec591ce63a9f33912cfe626ab2e3783652f0e2456f3","observation_id":"0e4b58c6-1b82-4790-b85a-10630cd29029","resolution":{"observed_at":"2026-08-02T02:44:13.955654Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.28488","last_updated":"2026-05-12T00:38:08Z","snapshot_observed_at":"2026-08-01T14:50:59.354142Z","submitted_at":"2026-03-30T14:23:15Z","title":"Courtroom-Style Multi-Agent Debate with Progressive RAG and Role-Switching for Controversial Claim Verification","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.28488","snapshot_observed_at":"2026-08-02T02:44:14.030820Z","title":"Courtroom-style multi-agent debate with progressive rag and role-switching for controversial claim verification.arXiv preprint arXiv:2603.28488, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.030820Z"},"links":{"cited_paper":"/paper/2603.28488","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:7073bae10caf41864c4b71c4efcaa692ca91bdada86bc6c9b2144fe2de607d61","observation_id":"756d73ff-2ec1-4636-81fd-ecb371ac8b24","resolution":{"observed_at":"2026-08-02T02:44:14.030820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.131820Z","title":"Improv- ing factuality and reasoning in language models through multiagent debate","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.131820Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:ed0dab4a77f3064e5f05f8c5e767f01c5ad651da19a9f93e7f2a85e51ce11415","observation_id":"482ba05c-36e7-4bbd-96b1-5fffbe61dc7b","resolution":{"observed_at":"2026-08-02T02:44:14.131820Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.201724Z","title":"Bad students make great teachers: Active learning accelerates large-scale visual understanding","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.201724Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:aa544841096573f69faabef314f9ba93b2251fdc96d7524a528374daf1ae7da7","observation_id":"2d181dc7-b008-4baf-9ebb-65978dae824b","resolution":{"observed_at":"2026-08-02T02:44:14.201724Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.292307Z","title":"Contextnav: Towards agentic multimodal in-context learning.arXiv preprint arXiv:2510.04560, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.292307Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:7af764d066c9519e2d09750d52c083516e37f9b1116ba0bf6117b42c24528d0d","observation_id":"15ff5940-23fc-4a59-830b-8f83a5e745a9","resolution":{"observed_at":"2026-08-02T02:44:14.292307Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.406045Z","title":"Adversarial defense in vision-language models: An overview","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.406045Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:69605ae6228c955a8ac5ba3bea46b218c062f3d509a8035764abe86e9fbf0669","observation_id":"41636004-8125-44d0-958a-94928a86f81f","resolution":{"observed_at":"2026-08-02T02:44:14.406045Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2603.23455","last_updated":"2026-06-30T04:40:05Z","snapshot_observed_at":"2026-07-13T19:37:58.775361Z","submitted_at":"2026-03-24T17:26:55Z","title":"DetPO: In-Context Learning with Multi-Modal LLMs for Few-Shot Object Detection","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2603.23455","snapshot_observed_at":"2026-08-02T02:44:14.501395Z","title":"Detpo: In-context learning with multi-modal llms for few-shot object detection","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.501395Z"},"links":{"cited_paper":"/paper/2603.23455","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:2b2f23db262d3f5d33baef74087556c283f17da2147fa1e005a703870579036c","observation_id":"64785b11-9b35-4244-b252-0f932846d848","resolution":{"observed_at":"2026-08-02T02:44:14.501395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.602511Z","title":"Debate, deliberate, decide (d3): A cost-aware adversarial framework for reliable and interpretable llm evaluation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.602511Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:6274ca6bee714cc1fede8d5d2d7e93d3260391f03802b0084dbea25709ec08f8","observation_id":"dd6e3a12-bcfc-4e2a-bc28-fdd9f16717ec","resolution":{"observed_at":"2026-08-02T02:44:14.602511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.693049Z","title":"Aetheria: A multimodal interpretable content safety framework based on multi-agent debate and collaboration.arXiv preprint arXiv:2512.02530, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.693049Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:97c42e7ba674df772218c351130fcc9ca30641c484570a8f8404194c213c27a9","observation_id":"ca22c62f-9c53-4427-ae90-2a3130017d0f","resolution":{"observed_at":"2026-08-02T02:44:14.693049Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.05113","last_updated":"2025-06-06T17:08:12Z","snapshot_observed_at":"2026-07-30T22:37:36.810027Z","submitted_at":"2024-06-07T17:44:32Z","title":"LlavaGuard: An Open VLM-based Framework for Safeguarding Vision Datasets and Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.05113","snapshot_observed_at":"2026-08-02T02:44:14.769734Z","title":"Llavaguard: An open vlm-based framework for safeguarding vision datasets and models.arXiv preprint arXiv:2406.05113, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.769734Z"},"links":{"cited_paper":"/paper/2406.05113","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:ad459e38efa0afda3cdb5b41484d76fea3a39787cdbf373770dcfd8fd06ee91e","observation_id":"13e9c64d-93e5-40cb-8bae-88ef7353e82a","resolution":{"observed_at":"2026-08-02T02:44:14.769734Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.09316","last_updated":"2025-02-13T13:30:54Z","snapshot_observed_at":"2026-07-06T20:36:03.331331Z","submitted_at":"2025-02-13T13:30:54Z","title":"A Judge-free LLM Open-ended Generation Benchmark Based on the Distributional Hypothesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.09316","snapshot_observed_at":"2026-08-02T02:44:14.843081Z","title":"A judge-free llm open-ended generation benchmark based on the distributional hypothesis.arXiv preprint arXiv:2502.09316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.843081Z"},"links":{"cited_paper":"/paper/2502.09316","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9213eb6b40123515701e84625a123b4b8a6eee3704ec6b416d2fe977048924e5","observation_id":"d069afdb-8d62-4b5b-bf68-da6366714a31","resolution":{"observed_at":"2026-08-02T02:44:14.843081Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1805.00899","last_updated":"2018-10-22T17:36:07Z","snapshot_observed_at":"2026-07-06T06:37:02.085757Z","submitted_at":"2018-05-02T16:27:32Z","title":"AI safety via debate","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1805.00899","snapshot_observed_at":"2026-08-02T02:44:14.904515Z","title":"Ai safety via debate.arXiv preprint arXiv:1805.00899, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.904515Z"},"links":{"cited_paper":"/paper/1805.00899","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:210e5e8f2b9da92512940b266c7acaf09996073368af4777ebf7f74050640a84","observation_id":"a35ee8e3-d5dd-4d57-99ce-0c7df1dfd0e4","resolution":{"observed_at":"2026-08-02T02:44:14.904515Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:14.990323Z","title":"Adversarial attacks on multimodal large language models: A comprehensive survey.arXiv preprint arXiv:2603.27918, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:14.990323Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3ef7723f6ba3741fbc8d87fb7d9042ca54c9acc7c7fa8374159062f85a83fed1","observation_id":"91538c90-cdc5-4d1d-be9d-95236c6607c7","resolution":{"observed_at":"2026-08-02T02:44:14.990323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.074317Z","title":"Curriculum guided massive multi agent system solving for robust long horizon tasks.arXiv preprint arXiv:2512.08545, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.074317Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9545aa743b9104be7aa990374686665c4c9e7353c8f09041362ddfc7f065b93a","observation_id":"83e048fd-179d-4526-9624-52b5e4a6387b","resolution":{"observed_at":"2026-08-02T02:44:15.074317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.141754Z","title":"Evaluating nova 2.0 lite model under amazon’s frontier model safety framework.arXiv preprint arXiv:2601.19134, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.141754Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:a07b6815828f78060bc9c52513889ac06f2fa527b5747ebabb363ea68e8f4b0b","observation_id":"ddf61226-84f2-4a8b-98c8-c4d3febcff2b","resolution":{"observed_at":"2026-08-02T02:44:15.141754Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.193060Z","title":"Biasscope: Towards automated detection of bias in llm-as-a-judge evaluation.arXiv preprint arXiv:2602.09383, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.193060Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:355a21308e050da135f5d612f31b1709135d364c50596398da74a3d6daaf1dc3","observation_id":"a5eae34c-4ea6-4f95-971b-48f20d8970f9","resolution":{"observed_at":"2026-08-02T02:44:15.193060Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.275900Z","title":"T-map: Red-teaming llm agents with trajectory-aware evolutionary search.arXiv preprint arXiv:2603.22341, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.275900Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:a330ef3c8348799170a8fbca8596817955c4d6611ec24adabb16883d346e54dc","observation_id":"30ae7cc6-cf76-4203-828a-0d13922aa6b6","resolution":{"observed_at":"2026-08-02T02:44:15.275900Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2601.23143","last_updated":"2026-05-13T02:16:49Z","snapshot_observed_at":"2026-07-06T22:43:45.998263Z","submitted_at":"2026-01-30T16:31:02Z","title":"THINKSAFE: Self-Generated Safety Alignment for Reasoning Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2601.23143","snapshot_observed_at":"2026-08-02T02:44:15.360226Z","title":"Thinksafe: Self-generated safety alignment for reasoning models.arXiv preprint arXiv:2601.23143, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.360226Z"},"links":{"cited_paper":"/paper/2601.23143","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:56d5715fbb58fea4c5acd087fd12c746d94262fd074f0eb644b9a8f1b4508466","observation_id":"9137ca88-9e26-4c79-86cf-143d26060fda","resolution":{"observed_at":"2026-08-02T02:44:15.360226Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.415061Z","title":"Holisafe: Holistic safety benchmarking and modeling for vision- language model.arXiv preprint arXiv:2506.04704, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.415061Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:5efce347b7ea8b3caa5743cc99161c45b135cff2b8bcab930c3e305586390d9e","observation_id":"923205e8-ed21-4f3d-8ddd-1697e24ec7a1","resolution":{"observed_at":"2026-08-02T02:44:15.415061Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.502229Z","title":null,"venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.502229Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:594757ecbcbfc455812548aa2ca4c0a67e4c9f68231d5b035597a8e2b15aabd3","observation_id":"07572d23-b8af-4145-a2de-79170a537b03","resolution":{"observed_at":"2026-08-02T02:44:15.502229Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.559113Z","title":"From generation to judg- ment: Opportunities and challenges of llm-as-a-judge","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.559113Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:81b591acbb2c249a9cc4e920d0f6d704114d356dbb1d9afc9fe0a8158f359699","observation_id":"9594631e-637b-42b6-9e7e-8911513f7531","resolution":{"observed_at":"2026-08-02T02:44:15.559113Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.22316","last_updated":"2026-02-03T11:44:29Z","snapshot_observed_at":"2026-07-06T21:48:45.170162Z","submitted_at":"2025-06-27T15:25:23Z","title":"Evaluating Scoring Bias in LLM-as-a-Judge","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.22316","snapshot_observed_at":"2026-08-02T02:44:15.637387Z","title":"Evaluating scoring bias in llm-as-a-judge.arXiv preprint arXiv:2506.22316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.637387Z"},"links":{"cited_paper":"/paper/2506.22316","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:bf0986608713f23c41d72d8c3b1ac847b99648c7a73f8cb109b57711e6fafb0b","observation_id":"f808fac0-18f9-4a75-be1a-ba4060ee7ead","resolution":{"observed_at":"2026-08-02T02:44:15.637387Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.711786Z","title":"Who judges the judge? llm jury-on-demand: Building trustworthy llm evaluation systems.arXiv preprint arXiv:2512.01786, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.711786Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:d981b2e7410a82a3ac30b47eeca2269302d7cf6d27d59eab42acfe70eff23931","observation_id":"9d216852-3fe2-4f35-8201-37ac60540127","resolution":{"observed_at":"2026-08-02T02:44:15.711786Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.789634Z","title":"Benchmark test-time scaling of general llm agents.arXiv preprint arXiv:2602.18998, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.789634Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:b788fc98a65db15835b53e4a58eff437c9cce9d5c222eff99b5142a8970d14bd","observation_id":"67fad8d2-9f74-4a5c-82a7-14a406e4c347","resolution":{"observed_at":"2026-08-02T02:44:15.789634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:15.871821Z","title":"Elhplan: Efficient long-horizon task planning for multi-agent collaboration.arXiv preprint arXiv:2509.24230, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.871821Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:51efe34c05834207e38df38be127ceece0933a7ea62d669c4776b55865aabf5d","observation_id":"1df74600-1e78-46b9-8622-439d85ef6787","resolution":{"observed_at":"2026-08-02T02:44:15.871821Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.09731","last_updated":"2024-02-16T17:30:41Z","snapshot_observed_at":"2026-07-06T16:48:29.239105Z","submitted_at":"2023-11-16T10:02:40Z","title":"Examining LLMs' Uncertainty Expression Towards Questions Outside Parametric Knowledge","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.09731","snapshot_observed_at":"2026-08-02T02:44:15.960327Z","title":"Examining llms’ uncertainty expression towards questions outside parametric knowledge.arXiv preprint arXiv:2311.09731, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:15.960327Z"},"links":{"cited_paper":"/paper/2311.09731","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:85abe7ae16d0806322947fe42b602fb6ad3ee5303caa21243db21352dfc1ded7","observation_id":"8ab350e0-6b97-41c7-ab24-217c230c7269","resolution":{"observed_at":"2026-08-02T02:44:15.960327Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.12997","last_updated":"2026-07-22T21:19:00Z","snapshot_observed_at":"2026-07-26T17:20:05.973375Z","submitted_at":"2025-11-17T05:38:50Z","title":"WebCoach: Self-Evolving Web Agents with Cross-Session Memory Guidance","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.12997","snapshot_observed_at":"2026-08-02T02:44:16.036683Z","title":"We- bcoach: Self-evolving web agents with cross-session memory guidance.arXiv preprint arXiv:2511.12997, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.036683Z"},"links":{"cited_paper":"/paper/2511.12997","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:41415cc7817ea6a7732ebfe2eb415e41499ed2bf9dab89975ee311e0915a77cc","observation_id":"dd68d04f-a297-440d-af26-260c3a2cfa9d","resolution":{"observed_at":"2026-08-02T02:44:16.036683Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.085510Z","title":"Mosaic: Modeling social ai for content dissemination and regulation in multi-agent simulations","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.085510Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9599e9a2183b4c856239f075723193a79c7198dd6d61fafbf1c0cbf5366b401b","observation_id":"7ce210d1-3829-4b1c-812a-83df63e4f122","resolution":{"observed_at":"2026-08-02T02:44:16.085510Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.135485Z","title":"Mtmcs-bench: Evaluating contextual safety of multimodal large language models in multi-turn dialogues.arXiv preprint arXiv:2601.06757, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.135485Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:cc53b5e54afe7bc97f5a3afb29a1d46776784771e939e5f89b29eeefff0eb29e","observation_id":"5ab79f7c-a3bc-497f-8223-45b369e101bb","resolution":{"observed_at":"2026-08-02T02:44:16.135485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.185073Z","title":"Ai debate aids assessment of controversial claims.arXiv preprint arXiv:2506.02175, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.185073Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:d6c5bb8d9628f11701f6546d06683d7aa4a3d57c8e3e7556510561a94a5aa135","observation_id":"531fa067-92e2-407c-a07f-12b8772125dc","resolution":{"observed_at":"2026-08-02T02:44:16.185073Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.13203","last_updated":"2025-08-23T02:09:57Z","snapshot_observed_at":"2026-07-06T21:11:10.415720Z","submitted_at":"2025-04-15T16:11:28Z","title":"X-Teaming: Multi-Turn Jailbreaks and Defenses with Adaptive Multi-Agents","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.13203","snapshot_observed_at":"2026-08-02T02:44:16.255412Z","title":"X-teaming: Multi-turn jailbreaks and defenses with adaptive multi-agents.arXiv preprint arXiv:2504.13203, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.255412Z"},"links":{"cited_paper":"/paper/2504.13203","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:167e9d16b4b0397a995d8328832f19847f375a0b0b1fa2a5a46016312f75e0cf","observation_id":"9236d518-02f5-4c78-86c7-a3e914e97b47","resolution":{"observed_at":"2026-08-02T02:44:16.255412Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.307323Z","title":"Disc-amc: Token-and parameter-efficient discretized statistics in-context automatic modulation classification.arXiv preprint arXiv:2510.00316, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.307323Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:e8c14894f79ed0b848ceab63c8d69d3db7c74e28bcc89b3d190df596bccf0884","observation_id":"ffb7c359-7219-48e5-bcf7-2e1325c7a3cd","resolution":{"observed_at":"2026-08-02T02:44:16.307323Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2510.10002","last_updated":"2026-07-14T18:21:16Z","snapshot_observed_at":"2026-07-18T23:18:01.941837Z","submitted_at":"2025-10-11T04:06:07Z","title":"Interaction Protocol Shapes Moral Judgment in Multi-Agent Debate","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2510.10002","snapshot_observed_at":"2026-08-02T02:44:16.371761Z","title":"Deliberative dynamics and value alignment in llm debates.arXiv preprint arXiv:2510.10002, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.371761Z"},"links":{"cited_paper":"/paper/2510.10002","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:577e25bf84adb79d9698d92b9dac64dc05b0c767f80982c72431dbeeb435caf4","observation_id":"7058828b-0ee1-4b46-a2c9-16c53fc97cb7","resolution":{"observed_at":"2026-08-02T02:44:16.371761Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17830","last_updated":"2024-03-26T16:10:21Z","snapshot_observed_at":"2026-07-06T17:51:24.261505Z","submitted_at":"2024-03-26T16:10:21Z","title":"Assessment of Multimodal Large Language Models in Alignment with Human Values","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17830","snapshot_observed_at":"2026-08-02T02:44:16.420847Z","title":"Assessment of multimodal large language models in alignment with human values.arXiv preprint arXiv:2403.17830, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.420847Z"},"links":{"cited_paper":"/paper/2403.17830","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:6135392bb9eab147585aa2e2513b86e3416a04e3a111fda335cd79b4cfd04684","observation_id":"95cefedf-3041-4473-b764-6c41c76f0066","resolution":{"observed_at":"2026-08-02T02:44:16.420847Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.446615Z","title":"Llm-as-a-judge for time series explanations.arXiv preprint arXiv:2604.02118, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.446615Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:b52bc3ec91752f7c5e73eb166da3522f2828617658c4cba53f68df2dea2bac14","observation_id":"b3ab628d-ad3d-427c-a6a4-17e7ae4e68e0","resolution":{"observed_at":"2026-08-02T02:44:16.446615Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.513676Z","title":"Unigame: Turning a unified multimodal model into its own adversary.arXiv preprint arXiv:2511.19413, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.513676Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3aa8b1d9a21f7e3118049b3c6bb909beb4eb7738a9097e6d46333d1b91dcf29c","observation_id":"120bdebe-f285-4bb1-bb70-5a21c75d58a0","resolution":{"observed_at":"2026-08-02T02:44:16.513676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.574250Z","title":"Supporting human raters with the detection of harmful content using large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.574250Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:2dc1c2047ee864a758080e0e4bbd492652d0570b646d2bd2a3906b90fa69e309","observation_id":"b5435b84-4cfe-4289-a100-9e21c2b2aba3","resolution":{"observed_at":"2026-08-02T02:44:16.574250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.631763Z","title":"Automated concept discovery for llm-as-a-judge preference analysis.arXiv preprint arXiv:2603.03319, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.631763Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c089c7752f9bbf0b394bc39308102ca89df1da137de66fdb9904291091e9e08d","observation_id":"26823bb7-34c3-4c03-b006-82a95b9ab134","resolution":{"observed_at":"2026-08-02T02:44:16.631763Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.691039Z","title":"Can llm agents really debate? a controlled study of multi-agent debate in logical reasoning.arXiv preprint arXiv:2511.07784, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.691039Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:3ae57899b03d9f63559f78ff17f538346350422f476b38438583e6063e91dbaf","observation_id":"ae09ccf1-033f-4661-b6d9-4cdeb3e18042","resolution":{"observed_at":"2026-08-02T02:44:16.691039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.10287","last_updated":"2026-04-07T03:18:14Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-11-13T13:18:27Z","title":"OutSafe-Bench: A Benchmark for Multimodal Offensive Content Detection in Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.10287","snapshot_observed_at":"2026-08-02T02:44:16.755987Z","title":"Outsafe- bench: A benchmark for multimodal offensive content detection in large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.755987Z"},"links":{"cited_paper":"/paper/2511.10287","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:a3ee39fc770b0a98a41af341a2ba26c4a0d00eeaa44ec9354f0bc17f41651dba","observation_id":"9921a8aa-53d0-4ed6-8c6d-f66a804b1077","resolution":{"observed_at":"2026-08-02T02:44:16.755987Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.818828Z","title":"Llama-3.1-foundationai- securityllm-reasoning-8b technical report.arXiv preprint arXiv:2601.21051, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.818828Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:9248040a50ae82f1e13168f693a5f292dac03463913e7df6dad8a6359cd09429","observation_id":"808993bb-8fe5-42ae-b424-758395746a7d","resolution":{"observed_at":"2026-08-02T02:44:16.818828Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02994","last_updated":"2025-08-05T01:42:25Z","snapshot_observed_at":"2026-07-06T22:07:49.742453Z","submitted_at":"2025-08-05T01:42:25Z","title":"When AIs Judge AIs: The Rise of Agent-as-a-Judge Evaluation for LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.02994","snapshot_observed_at":"2026-08-02T02:44:16.888129Z","title":"When ais judge ais: The rise of agent-as-a-judge evaluation for llms.arXiv preprint arXiv:2508.02994, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.888129Z"},"links":{"cited_paper":"/paper/2508.02994","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:6eba25ad1159ca2205219d734939afc359b3c60f1c64e753ee606ec995e22cf8","observation_id":"243d2632-a2f4-454d-a540-90894987e1cb","resolution":{"observed_at":"2026-08-02T02:44:16.888129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:16.956146Z","title":"Evolving contextual safety in multi-modal large language models via inference-time self-reflective memory.arXiv preprint arXiv:2603.15800, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:16.956146Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:2092de12f6dee1829774540862b287f3333a4ccfc885c0a722f291138d13547c","observation_id":"d7e7d1ef-c352-43da-8b8c-b317f6c69775","resolution":{"observed_at":"2026-08-02T02:44:16.956146Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.016819Z","title":"Visual exclusivity attacks: Automatic multimodal red teaming via agentic planning.arXiv preprint arXiv:2603.20198, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.016819Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:5eb3a9add3736dbe8b658fdfe0b9a64f03ae8439929ddc66b5f86476ce784815","observation_id":"91a72551-1176-4d1c-9b5d-d29132eb03b7","resolution":{"observed_at":"2026-08-02T02:44:17.016819Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.19148","last_updated":"2025-06-12T04:05:38Z","snapshot_observed_at":"2026-07-06T20:43:04.512262Z","submitted_at":"2025-02-26T14:07:37Z","title":"Amulet: ReAlignment During Test Time for Personalized Preference Adaptation of LLMs","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.19148","snapshot_observed_at":"2026-08-02T02:44:17.054063Z","title":"Amulet: Realignment during test time for personalized preference adaptation of llms.arXiv preprint arXiv:2502.19148, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.054063Z"},"links":{"cited_paper":"/paper/2502.19148","citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:62884f57828c14b162261494c5dffef916e17101d1684a1ca7525063cda94b84","observation_id":"b2f95ed4-09d2-4d0e-a9f8-f48b33a53814","resolution":{"observed_at":"2026-08-02T02:44:17.054063Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.106150Z","title":"inhumane conditions","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.106150Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:64bdaf10adaf2f98a88348139d089ec41f04b31861a24346c6c6390f315c9b57","observation_id":"bc460a0f-f52e-4af6-8b41-e9d10122f13f","resolution":{"observed_at":"2026-08-02T02:44:17.106150Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.183685Z","title":"{policy_text}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.183685Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:c9181e9989d049b98f4a7e3c1824d245b90b8241c57b21c1f9c05c7e45975c18","observation_id":"24c00459-75db-4a1e-8d9b-515db75a8ca2","resolution":{"observed_at":"2026-08-02T02:44:17.183685Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.271516Z","title":"This synthesizes a complete context block explicitly documenting the distinct arguments for and against each candidate classification label","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.271516Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:cff910af7f44b5e2077ea8ea2133b278b7a8f8d3ff78ebee763d4190207df09b","observation_id":"4aaef1b5-e16b-45b9-b010-037a7d8986f6","resolution":{"observed_at":"2026-08-02T02:44:17.271516Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.347594Z","title":"{policy_text}","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.347594Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:4ceebc845cd719228ef56fc512cbff8ff5da63200e8e2ba3a94cabcb283b6796","observation_id":"0af11b24-c32d-4db8-bc87-8fd0451384ff","resolution":{"observed_at":"2026-08-02T02:44:17.347594Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-02T02:44:17.432243Z","title":"If any dissent continues even after the debate round, the system automatically categorizes the instance as a deadlock and escalates it to the Level II Jury Committee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-02T02:44:17.432243Z"},"links":{"citing_paper":"/paper/2607.14256"},"observation_digest":"sha256:10c72199bd055458fd225f2916d49fc47bc91fcf6b5013c4351b9d5fb2a02e5a","observation_id":"a4c2016a-a3d2-46bc-b8c6-7d70ce6315a9","resolution":{"observed_at":"2026-08-02T02:44:17.432243Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.14256","last_updated":"2026-07-15T18:13:05Z","latest_version":1,"primary_category":"cs.AI","snapshot_observed_at":"2026-08-02T02:44:12.540392Z","submitted_at":"2026-07-15T18:13:05Z","title":"Automatic Hard Example Synthesis with Multi-Level Agentic Data Curation"},"reference_resolution":{"displayed":57,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":57},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-01T06:32:01.292127+00:00","source":"crossref"},{"observed_at":"2026-08-01T06:31:58.492377+00:00","source":"retraction_watch"}],"thesis":"As of 2 August 2026, this Paper Citation Record lists 57 of 57 outbound references and 0 inbound Pith citation observations for arXiv:2607.14256."}