{"as_of":"2026-08-05T21:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:19fcab6258ca8ea10343eda2d039af1a55923105af21f54b6f209ff5cb533454","coverage":[{"denominator":90,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":90,"source":"paper_references, paper_reference_links","source_observed_at":"2026-06-28T18:36:46.381564Z","state":"measured"},{"denominator":90,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":90,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2606.00931/citation-record","integrity":"/paper/2606.00931/integrity","json":"/paper/2606.00931/citation-record.json","paper":"/paper/2606.00931"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2303.08774","last_updated":"2024-03-04T06:01:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-03-15T17:15:04Z","title":"GPT-4 Technical Report","version":6},"cited_work":{"arxiv_id":"2303.08774","doi":"10.1002/tea.20265","metadata_source":"pith","pith_arxiv_id":"2303.08774","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"GPT-4 Technical Report","venue":"cs.CL","work_id":"b928e041-6991-4c08-8c81-0359e4097c7b","year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2303.08774","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:2e14935d0238fea6f53ef42f4745ae1f3856151a099851946b7c2b0bed3f5aa5","observation_id":"2e3a18ed-2c9c-43b9-989a-4b4062c2caf4","resolution":{"observed_at":"2026-06-28T20:32:37.612500Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Rank analysis of incomplete block designs: I","venue":null,"work_id":null,"year":1952},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:1dd47a7616d03fa71e41174a776f20e1b66d9f21624114a374333fd94dd89aa7","observation_id":"8c0b2a7b-5318-4f75-8ff1-12eb27905582","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":null,"venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:2b90cc1c4a070d50846c71146b32c2e4b85a750494bc6e0048dbf58782cd4c47","observation_id":"ed29445d-ea82-4caf-b8d8-b181fae8b5f7","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Instruction-based image manipulation by watching how things move","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:4d6d5036a2699b90d3cd6715a439d1467cb53b05b903f0a85756b1e3e767dacf","observation_id":"3aede378-7a8a-4d7e-a914-7377a2ff3d67","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03107","last_updated":"2025-06-11T06:11:36Z","snapshot_observed_at":"2026-07-06T21:35:56.582332Z","submitted_at":"2025-06-03T17:39:47Z","title":"ByteMorph: Benchmarking Instruction-Guided Image Editing with Non-Rigid Motions","version":2},"cited_work":{"arxiv_id":"2506.03107","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.03107","snapshot_observed_at":"2026-07-04T00:09:13.963661Z","title":"Bytemorph: Benchmarking instruction- guided image editing with non-rigid motions.ArXiv, abs/2506.03107","venue":null,"work_id":"8729a5f7-a8aa-43f1-8724-d77948f05226","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2506.03107","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:26ccc490c4cc626919a118ad154b180fb847c0498fbec87b6ed023a8ed59dd41","observation_id":"48a844db-b0d8-49d6-bc59-44f0f3faed6d","resolution":{"observed_at":"2026-06-28T20:32:37.615780Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Chen, Misha Sra, and Pradeep Sen","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:a91aba0680fdd922060581cb74185dd8b05731b8e54f3804fc90e1ef23afdd99","observation_id":"24874fbc-6218-41ae-babe-5bec8da4395d","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Hierarchical integration diffusion model for realistic image deblurring.Advances in neural information processing systems, 36:29114–29125, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:65a6e868b61b70e1d79a6332d0d99b38b316456d33adf793d6e7865bd7cb1d1d","observation_id":"acc03c55-fab5-4706-a395-036771430ba8","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.24900","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T20:32:37.617033Z","title":"Opengpt-4o-image: A compre- hensive dataset for advanced image generation and editing","venue":null,"work_id":"f07ca17f-4c08-44bb-ad68-8cc8d865bf89","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:5628e8b5596351d776d34700f16b2436399762d387c5d4584c35a2c31924d784","observation_id":"8cdb5182-13f6-4e81-a178-793858d562e9","resolution":{"observed_at":"2026-06-28T20:32:37.618870Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.05476","last_updated":"2024-03-04T13:30:44Z","snapshot_observed_at":"2026-07-06T16:59:07.330432Z","submitted_at":"2023-12-09T06:08:09Z","title":"Exploring the Naturalness of AI-Generated Images","version":3},"cited_work":{"arxiv_id":"2312.05476","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2312.05476","snapshot_observed_at":"2026-06-28T20:32:37.622742Z","title":"Exploring the naturalness of ai-generated images.arXiv preprint arXiv:2312.05476, 2023","venue":null,"work_id":"77a481c0-6828-4a3d-8836-9c5fd57614a1","year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2312.05476","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:6fa18f4733f2ca372f7c32f708d605370d913c791a5b52a93bcb0f3115e35e1a","observation_id":"1d0e600b-b650-498c-abf6-a52f383e5036","resolution":{"observed_at":"2026-06-28T20:32:37.624377Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04132","last_updated":"2024-03-07T01:22:38Z","snapshot_observed_at":"2026-08-02T17:55:33.750637Z","submitted_at":"2024-03-07T01:22:38Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","version":1},"cited_work":{"arxiv_id":"2403.04132","doi":"10.1007/s11336-009-9136-x","metadata_source":"pith","pith_arxiv_id":"2403.04132","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chatbot Arena: An Open Platform for Evaluating LLMs by Human Preference","venue":"cs.AI","work_id":"a1eb83da-5727-4b63-977f-81c6fdd33936","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2403.04132","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:a4162af331983ac0725fde27a2dbe166273b39304f2400da8f9f854efc67df37","observation_id":"cff335cc-ace1-47a5-929b-402bda8803e9","resolution":{"observed_at":"2026-06-28T20:32:37.621567Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":"2507.06261","doi":"10.48550/arxiv.2503.19","metadata_source":"pith","pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-11T03:17:51.364436Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","venue":"cs.CL","work_id":"008df105-2fdd-45d8-857a-8e35868aecb6","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:ff9931e0d822c558cb3eff7d0c03671111678072d36f01cbd7c8c1d3d962e458","observation_id":"863c67e1-32aa-4ad2-8a5c-dc1d9fdf3ad0","resolution":{"observed_at":"2026-06-28T20:32:37.629772Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10526","last_updated":"2020-03-20T12:36:30Z","snapshot_observed_at":"2026-07-06T08:17:20.450438Z","submitted_at":"2019-08-28T02:44:13Z","title":"Image Harmonization Dataset iHarmony4: HCOCO, HAdobe5k, HFlickr, and Hday2night","version":4},"cited_work":{"arxiv_id":"1908.10526","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"1908.10526","snapshot_observed_at":"2026-06-28T20:32:37.590497Z","title":"Image harmonization dataset iharmony4: Hcoco, hadobe5k, hflickr, and hday2night.arXiv preprint arXiv:1908.10526, 2019","venue":null,"work_id":"684b2997-7dc8-4487-88f9-c30944992f37","year":1908},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/1908.10526","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:32102d927a3cabf27d30e78b5c052f6cef9c327ef0e155834dd25f7da0beffb4","observation_id":"f3d7c6ef-df96-4913-9ce9-4fe9052b49b1","resolution":{"observed_at":"2026-06-28T20:32:37.592447Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Introducing gemini 2.5 flash image, our state-of-the-art image model, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:1201f84f944d78219532a3f0719138d774ea7c8382c0693ad933ff507c843223","observation_id":"f150eb95-2708-4021-a7de-7fc1b16e89bf","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Introducing nano banana pro, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:9c325b3ad9ad4786edb04a78d237990bab88c179bdae2540865fe039193fc51b","observation_id":"c5b7aed5-0caf-40c4-b40d-df3edcafe3dc","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Imagenet: A large- scale hierarchical image database","venue":null,"work_id":null,"year":2009},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:7d2a51522b7262b100cf0a2e12e3164c828f34541b590f3d8637bcf9d5d81281","observation_id":"c7e331aa-2342-49aa-9e2b-baa0f9def01f","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.04475","last_updated":"2025-03-10T09:27:03Z","snapshot_observed_at":"2026-07-06T17:56:23.317089Z","submitted_at":"2024-04-06T02:29:02Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","version":2},"cited_work":{"arxiv_id":"2404.04475","doi":"10.48550/arxiv.2404.04475","metadata_source":"pith","pith_arxiv_id":"2404.04475","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Length-Controlled AlpacaEval: A Simple Way to Debias Automatic Evaluators","venue":"cs.LG","work_id":"ef25adcf-addb-445e-b3b5-858eeb9883ca","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2404.04475","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:76fc1f56fcba6cd993d29c3237e49468b3ec813685a539c6cdc9632457a899b4","observation_id":"ea12670a-a162-43c8-bac6-95892badd345","resolution":{"observed_at":"2026-06-28T20:32:37.599339Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Alpacafarm: A simulation framework for methods that learn from human feedback.Advances in Neural Information Processing Systems, 36:30039–30069, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:b53c0b3c58b04a0951ba6f4b4df2e0dbf1ebf66eb603af624872ce7bb37034a5","observation_id":"596e37b0-6b0c-452b-91b0-4936ebf79b7d","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Image classification based on cnn: a survey.Journal of Cybersecurity and Information Management, 6(1):18–50, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3664befc0c2bd899a04f147962425fe5b3072af8603c8027317c9a8ab1738f06","observation_id":"cb9d8cb6-6778-47d2-8c7f-a13a2564c6fe","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Recognition-synergistic scene text editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:16d22674739cb8da3ac919b5aa72dd4e4a45426934645d1fc18e8bf20abf58d5","observation_id":"168ccb47-7b68-4366-bd25-1b9242ea93ea","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"prentice hall professional technical reference, 2002","venue":null,"work_id":null,"year":2002},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:9e77e6c237809b0f64b3b058228e9f615e0673f4a622efb4395dcbcbb53fbb88","observation_id":"8553de81-5ab1-4d5d-b9bf-07f614e5de98","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2405.04007","last_updated":"2024-05-07T04:55:47Z","snapshot_observed_at":"2026-08-03T14:34:50.944594Z","submitted_at":"2024-05-07T04:55:47Z","title":"SEED-Data-Edit Technical Report: A Hybrid Dataset for Instructional Image Editing","version":1},"cited_work":{"arxiv_id":"2405.04007","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2405.04007","snapshot_observed_at":"2026-07-03T00:47:29.665670Z","title":"Seed-data-edit technical report: A hybrid dataset for in- structional image editing.arXiv preprint arXiv:2405.04007","venue":null,"work_id":"105b7ef7-4ded-4a79-bc59-ba1b3f7061b8","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2405.04007","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:91430cb1185cbb7a1522b36c65e54c2659f64aa420f7c8e4ffa4cb0bc7399b2d","observation_id":"5c97c955-0ab0-49b5-9e90-cf1ddd2f3c5a","resolution":{"observed_at":"2026-06-28T20:32:37.595446Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Gemini 2.5 pro model card, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:0f81d954893c6fcab55c10cd4f0ce014b9ad340f680ca27e7db9818475e86a06","observation_id":"4389e0ac-5ba0-4c03-a40d-80669c03ba1a","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Multi- reward as condition for instruction-based image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:608443f3472a3c8a1f00ae27edec8a2f785f3705fedf22fa57c347f681bef34d","observation_id":"377f9fb9-1acb-49e6-bc0c-1dd9e87ef5e0","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Improving visual and downstream performance of low-light enhancer with vision foun- dation models collaboration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:b54f9a63e433361c1978c4165e8f6b442182b05a7fee8f58f7d3cbab6cb2b89e","observation_id":"ec999732-e24d-4d8a-83c2-e624c55c0751","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.01680","last_updated":"2024-04-19T01:15:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-01-21T23:36:14Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","version":2},"cited_work":{"arxiv_id":"2402.01680","doi":"10.48550/arxiv.2402.01680","metadata_source":"pith","pith_arxiv_id":"2402.01680","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Large Language Model based Multi-Agents: A Survey of Progress and Challenges","venue":"cs.CL","work_id":"fb905249-ea5f-4765-80f0-2428ea66f15f","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2402.01680","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:14f15b59d1011b9ff030838f70d52ff6fc6a6c9be3c2d957ab5733441efc2114","observation_id":"18fb0d97-acfd-4ed5-8c50-668cfa366be2","resolution":{"observed_at":"2026-06-28T20:32:37.632473Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Clip and complementary methods.Nature Reviews Methods Primers, 1(1):20, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:03902b120cc3045a3bc9b25a798d26e2c0cb81d1a1bd7bbfb3226bc150914c09","observation_id":"14f20862-76ed-4941-af4a-d3c68ea457cd","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Clipscore: A reference-free evaluation metric for image captioning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:5c0120a3c2fe6ea439e1b7344003efb44073e6205aa87a4ad2379ffbec5271f9","observation_id":"5217d77f-7f0c-48e1-8f4a-0b01a52e2b7d","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.09990","last_updated":"2024-04-15T17:59:31Z","snapshot_observed_at":"2026-07-06T18:00:30.424554Z","submitted_at":"2024-04-15T17:59:31Z","title":"HQ-Edit: A High-Quality Dataset for Instruction-based Image Editing","version":1},"cited_work":{"arxiv_id":"2404.09990","doi":null,"metadata_source":"pith","pith_arxiv_id":"2404.09990","snapshot_observed_at":"2026-07-09T21:16:34.372456Z","title":"Hq-edit: A high-quality dataset for instruction-based image editing","venue":"cs.CV","work_id":"9d8a82a0-b08a-44fe-9165-95aded3e32be","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2404.09990","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:1abeb04f8677608da64831137dae51c9dac8a50c9607fa394bd02d69635a9996","observation_id":"c4df03ba-0e52-4237-ac40-9bdd834b42b4","resolution":{"observed_at":"2026-06-28T20:32:37.585601Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Grounding degradations in natural language for all-in-one video restoration","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:57aabd3893fa2d31e15e48724729ef4cd10f2d89ca464dd1f4f865a127d4829c","observation_id":"5c60f75b-3a33-44e3-a71a-2d14084e1af1","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2505.12200","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-01T14:25:45.991056Z","title":"Compbench: Benchmarking complex instruction-guided im- age editing","venue":null,"work_id":"3a1eb6c5-72c6-4cc6-800b-ec8907dc1133","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:78411c5e2a0932c5c6f7986e24d69b78e6b2837ba91c476c8af1b95df18ebcb3","observation_id":"88b80912-a439-448b-859e-77e789358fb4","resolution":{"observed_at":"2026-06-28T20:32:37.575072Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Genai arena: An open evaluation platform for generative models.Advances in Neural Information Processing Systems, 37:79889–79908, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:5760cbdc56b67effeb0c76bde62f31a8bf395157fc510cda1d694ad11c67218f","observation_id":"707fb822-5dde-4669-93fa-78f47fbb61d4","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"A new measure of rank correlation.Biometrika, 30(1-2):81–93, 1938","venue":null,"work_id":null,"year":1938},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:9f9f2a9f792d85bbc3c5893743f044366e6f16108fa42740cd334915394aac98","observation_id":"cb35f5cc-3334-4fb8-9e8e-b8c2e55d0ca7","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Orida: Object-centric real-world image composition dataset","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:1c18b629ad0fac99b6b27258cba88f958d62570e5bd2c2a7eb5928be688b7ed7","observation_id":"e1d8aefc-457b-404c-a23d-fdfa99caf958","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Peak signal-to-noise ratio revisited: Is simple beautiful? In 2012 Fourth International Workshop on Quality of Multimedia Experience, pages 37–38, 2012","venue":null,"work_id":null,"year":2012},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:37f9421edc99db04ba71837b9310e06d10ae253831e91c15ced0b8ede1bdf9db","observation_id":"2d3bde76-210a-4d4b-a36f-485161729bbe","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.01596","last_updated":"2024-03-10T21:41:51Z","snapshot_observed_at":"2026-07-06T16:26:46.131908Z","submitted_at":"2023-10-02T19:41:42Z","title":"ImagenHub: Standardizing the evaluation of conditional image generation models","version":4},"cited_work":{"arxiv_id":"2310.01596","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2310.01596","snapshot_observed_at":"2026-07-02T16:07:09.099618Z","title":"Imagenhub: Standardizing the evaluation of conditional image generation models.arXiv preprint arXiv:2310.01596,","venue":null,"work_id":"857dff1d-9f17-4510-9916-c90004d04de7","year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2310.01596","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:61e1a9513cbcb9f395006772136b141e220b150e1b3e164ce86d46a94d4ac280","observation_id":"8cfaee95-b128-4b2c-871a-7143f2a617e5","resolution":{"observed_at":"2026-06-28T20:32:37.644658Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"FLUX.2: Frontier Visual Intelligence","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:92c3d9983bb09bffdfd5a270fe23a68726c0826120bc7c2da2944042110364e5","observation_id":"22a46400-5b61-476c-9bbb-0f09152fbebf","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"The mnist database of handwritten digits.http://yann","venue":null,"work_id":null,"year":1998},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:43c22c5768250848a751d03cb19ffd7f32638bd73c14d6a7ca101bd71a7d50bc","observation_id":"e429ba20-bf89-4f39-870b-3aaab77a792f","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Superedit: Rectifying and facilitating supervision for instruction-based image editing","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:45e268a2a0fe8e6e4a6e8ffd935249d92cd4db8e9b3d5e101d9227e133ed72ef","observation_id":"c8d62317-b42b-4286-bc93-556b174d6eab","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Towards benchmarking and assessing visual naturalness of physical world adversarial attacks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:d482f0d5bd5efe2fc14c81c67f9a0cce5a85dd1a0258beeb948b3c8c95d264fa","observation_id":"22ad1cde-6f40-4652-b83b-98791270dafa","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.03147","last_updated":"2025-06-18T18:00:05Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-06-03T17:59:33Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","version":4},"cited_work":{"arxiv_id":"2506.03147","doi":null,"metadata_source":"pith","pith_arxiv_id":"2506.03147","snapshot_observed_at":"2026-07-05T16:51:14.197597Z","title":"UniWorld-V1: High-Resolution Semantic Encoders for Unified Visual Understanding and Generation","venue":"cs.CV","work_id":"488a273e-95d8-46f1-87c7-2244068d00d0","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2506.03147","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:8aa33305069ccc444d6429d8e8f0e4d866a7b8ee7f5b7296bdff407829ee7bce","observation_id":"21c835f5-2cab-4388-9700-38ff7f60f6d8","resolution":{"observed_at":"2026-06-28T20:32:37.622912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2511.23002","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-06-29T07:43:13.994646Z","title":"JarvisEvo: Towards a self-evolving photo editing agent with synergistic editor-evaluator optimization","venue":null,"work_id":"a8df6034-be76-449d-b2a7-7f7ae72db474","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:d714e190b751362349919336ba3337fcca0b3d271c4779844354e62c98b0b57e","observation_id":"025106a5-c18a-40d2-be9d-2083e6b2b4e4","resolution":{"observed_at":"2026-06-28T20:32:37.628095Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Referring image editing: Object-level image editing via referring expressions","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:e0966aeea5519419c4c6f3d5a2d60580f89f25190e963c298e89410652d12a60","observation_id":"d6e32994-c00f-418e-8c4b-41eb3ecab36e","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.17761","last_updated":"2025-07-31T05:05:45Z","snapshot_observed_at":"2026-07-06T21:14:24.007428Z","submitted_at":"2025-04-24T17:25:12Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","version":5},"cited_work":{"arxiv_id":"2504.17761","doi":null,"metadata_source":"pith","pith_arxiv_id":"2504.17761","snapshot_observed_at":"2026-07-10T01:46:41.223286Z","title":"Step1X-Edit: A Practical Framework for General Image Editing","venue":"cs.CV","work_id":"3392f2c8-a1cb-4d6c-8c82-2cdccffa33f9","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2504.17761","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:000cf78cf73cb2fddb08392ddf6cb4240ca13d14927abfa2c3e4ea9f021fb02a","observation_id":"47ac072c-06cb-4622-8286-766baf8b03a6","resolution":{"observed_at":"2026-06-28T20:32:37.596726Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05525","last_updated":"2024-03-11T16:47:41Z","snapshot_observed_at":"2026-08-05T16:51:32.094151Z","submitted_at":"2024-03-08T18:46:00Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","version":2},"cited_work":{"arxiv_id":"2403.05525","doi":"10.48550/arxiv.2403.05525","metadata_source":"pith","pith_arxiv_id":"2403.05525","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DeepSeek-VL: Towards Real-World Vision-Language Understanding","venue":"cs.AI","work_id":"30da36a4-b9ad-4618-8955-c09232b61343","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2403.05525","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:abf759551802ec69a2b81bca5c35f7885886223d53d5588b566e00cf3a9fa543","observation_id":"80c04ad7-75eb-4d42-a3f6-f645f0db001b","resolution":{"observed_at":"2026-06-28T20:32:37.609736Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Visual-instructed degradation diffusion for all-in-one image restoration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:917731c5cf2a93d28bca934e9ae113c4b41191f49880179dc850dbb64fdeb000","observation_id":"034601d8-1cb8-4b72-8141-8084d79ba198","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Visual autoregressive modeling for instruction-guided image editing.arXiv preprint, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:ad28b6d3e40ecc9988d18c642cb7b069ddb5e74b2e7f88b492c0b32c8fe4bc10","observation_id":"e98b2ac8-63bd-4f4c-a0e3-84809434e79c","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Introducing manus 1.6: Max performance, mobile dev, and design view, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:cc8a608ed293fd74e4c1916c3e8fe39c270dd7b4c678f3e06da33ca10a32290d","observation_id":"eabd01f2-b6bd-4b97-9910-e61684782c01","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Image segmentation using deep learning: A survey.IEEE transactions on pattern analysis and machine intelligence, 44(7):3523–3542, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:94cd09c7ad1098fcb8f90bb1746ef0aaa68187563806e00292b261c45238827f","observation_id":"a2397c5a-8687-4cfb-8097-ddcd7b045127","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"A comprehensive overview of large language models.ACM Transactions on Intelligent Systems and Technology, 16(5):1–72, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:044c82cc5f3ec013e071bad69c06844445c8ce4a622762478adbde7e9112d362","observation_id":"bfdd83d2-70fa-4ac5-84a5-f86201a6296d","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Gpt image 1, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:86cac50399c06179e9707b37246f7ee53444dd6c2459d62ef431539a3ed046e2","observation_id":"53df82ad-2914-436d-be67-3713b5aa7941","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Introducing chatgpt agent: bridging research and action, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:d087006b47d4222a5bbd3fc35946cc91585744f235fefef0345cf1404d6576ab","observation_id":"76b96bcb-97fb-4702-a46f-bc890cdd5741","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"The new chatgpt images is here, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:2beb03078ab87bf0f10ecadb275d1ddb8179347fecd2845800def3a6e820e9cb","observation_id":"1e509786-c2b2-43fe-aed7-f9d4ae0ef745","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Training language models to follow instructions with human feedback.Advances in neural information processing systems, 35:27730–27744, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:9463273e87d2ef1dc2e418aab3a40f269a876635503a8b74a170900987cceb77","observation_id":"fd813550-5c58-4815-890e-827036417517","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"The claude 3 model family: Opus, sonnet, haiku","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:22f8eeea3815d6bf0cd120ed9530318c380551b434be69bf96de851b745952a6","observation_id":"2b058496-36cd-4590-875e-9ce43db9f72b","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16855","last_updated":"2025-03-09T02:57:28Z","snapshot_observed_at":"2026-08-02T11:42:06.101787Z","submitted_at":"2024-06-24T17:58:47Z","title":"DreamBench++: A Human-Aligned Benchmark for Personalized Image Generation","version":2},"cited_work":{"arxiv_id":"2406.16855","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2406.16855","snapshot_observed_at":"2026-07-03T21:08:57.517878Z","title":"Dreambench++: A human-aligned bench- mark for personalized image generation","venue":null,"work_id":"07df1e79-a136-4532-b85e-ec5bd5030414","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2406.16855","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:9b3829e2a49a4732d41a90993f94cca799c8b7674995620886f46c8937197899","observation_id":"1e183c9a-c930-4294-b601-34b0e6ea3156","resolution":{"observed_at":"2026-06-28T20:32:37.641564Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2510.19808","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-02T07:06:43.979452Z","title":"Pico-banana-400k: A large-scale dataset for text-guided image editing","venue":null,"work_id":"13101bd5-0123-4ec6-842d-132b042d2013","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:46db2ac16667a94a9d9aa05541475a9678abbbc51cb93498aadf4ee583a12e7e","observation_id":"f03f231e-4bca-4600-8758-9c5af1147e80","resolution":{"observed_at":"2026-06-28T20:32:37.579050Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Ex- ploring stroke-level modifications for scene text editing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:e2b9b58a2b076de4143f5e24ac4f7a30d7412ba251522f11d471a796b37a3c45","observation_id":"2a24e0a3-660d-4e38-9eff-b5dfad871bb6","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Learning transferable visual models from natural language supervision","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3129d61aef05b45eeb0eef3a43ba3321afa1234babdc6ed31f67bb4f65e67c31","observation_id":"e984091a-9db3-4f48-9776-df0e0937dd84","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.20427","last_updated":"2025-12-10T16:37:54Z","snapshot_observed_at":"2026-07-06T22:30:41.141182Z","submitted_at":"2025-09-24T17:59:04Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","version":3},"cited_work":{"arxiv_id":"2509.20427","doi":null,"metadata_source":"pith","pith_arxiv_id":"2509.20427","snapshot_observed_at":"2026-07-11T00:07:42.259448Z","title":"Seedream 4.0: Toward Next-generation Multimodal Image Generation","venue":"cs.CV","work_id":"15c839a0-48a3-4218-82b6-cac5b7f66e13","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2509.20427","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:935d80e5c02bf8a6facd2f644c4923f2cb71c7794c3a0c133028dbd10d878721","observation_id":"4296f666-df00-44c2-9885-f3e4c8b84c69","resolution":{"observed_at":"2026-06-28T20:32:37.602095Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Insert anything: Image insertion via in-context editing in dit","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:ecbd9308dcc979bc597f80cefade5f2c0029fa4eb389f624cf5a2ba81b3b8e06","observation_id":"480d57ee-c0c3-4a77-ad97-cef0ff72f313","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Springer Nature, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:2262c69e9cc50e0b1a34e6d85a169c5c463cc652ce3aafa95b6701a4ad389ee9","observation_id":"90c5d327-cb1a-4621-b24e-fb90a5433f25","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.11805","last_updated":"2025-05-09T21:04:06Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-12-19T02:39:27Z","title":"Gemini: A Family of Highly Capable Multimodal Models","version":5},"cited_work":{"arxiv_id":"2312.11805","doi":"10.1038/nrn2888","metadata_source":"pith","pith_arxiv_id":"2312.11805","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Gemini: A Family of Highly Capable Multimodal Models","venue":"cs.CL","work_id":"83f7c85b-3f11-450f-ac0c-64d9745220b2","year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2312.11805","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:7b4b14645b365591ee347dd81f20ca43c9866a9c2ee236d630dd5482bc95a387","observation_id":"57f43309-3764-40e6-91c7-cfaf0f736835","resolution":{"observed_at":"2026-06-28T20:32:37.620552Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.07232","last_updated":"2024-11-12T07:49:39Z","snapshot_observed_at":"2026-07-06T19:48:36.508447Z","submitted_at":"2024-11-11T18:50:09Z","title":"Add-it: Training-Free Object Insertion in Images With Pretrained Diffusion Models","version":2},"cited_work":{"arxiv_id":"2411.07232","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2411.07232","snapshot_observed_at":"2026-07-01T14:25:46.030765Z","title":"arXiv preprint arXiv:2411.07232 , year=","venue":null,"work_id":"7ad26308-3c67-4558-b93e-486a1fecd946","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2411.07232","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:f9bae8aa6e69fded9171f8999320544ed004dcb94461c44833d4f6cc412e1f4e","observation_id":"862141b2-bfec-47aa-b8b9-9aa581ecf934","resolution":{"observed_at":"2026-06-28T20:32:37.615547Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.04493","last_updated":"2024-05-21T14:44:46Z","snapshot_observed_at":"2026-08-03T22:38:38.251915Z","submitted_at":"2024-03-07T13:49:43Z","title":"What makes an image realistic?","version":4},"cited_work":{"arxiv_id":"2403.04493","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2403.04493","snapshot_observed_at":"2026-06-28T20:32:37.629158Z","title":"What makes an image realistic?arXiv preprint arXiv:2403.04493, 2024","venue":null,"work_id":"a1639f0f-e827-41ed-980b-c7abbc39e17d","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2403.04493","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:7c17fb3e8af6b5800add83d117da8cebdf26c9809fe3b18a707adddb1a1a3816","observation_id":"08d74052-702a-4e58-acaf-970896d7a976","resolution":{"observed_at":"2026-06-28T20:32:37.630785Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Deep learning for computer vision: A brief review.Computational intelligence and neuroscience, 2018(1):7068349, 2018","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:995f3edad8a176c0e06af896231bc9d7fc7766e5901b64f4f2369f1908fde3c0","observation_id":"e33c27be-f90d-4671-8baf-4efe4242656e","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.20314","last_updated":"2025-04-19T02:22:42Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-03-26T08:25:43Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","version":2},"cited_work":{"arxiv_id":"2503.20314","doi":"10.1109/19.492748","metadata_source":"pith","pith_arxiv_id":"2503.20314","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Wan: Open and Advanced Large-Scale Video Generative Models","venue":"cs.CV","work_id":"ad3ebc3b-4224-46c9-b61d-bcf135da0a7c","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2503.20314","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:90a5d138f0002a632cc82953893b9989fdeac95a02faa7cf6e360aeb31a75244","observation_id":"56041e73-3196-4ea3-8697-e62b1e141dcd","resolution":{"observed_at":"2026-06-28T20:32:37.585668Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Adapting text-to-image generation with feature difference instruction for generic image restoration","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:77c919ec4f4a61546beae7390e767aa382e6e9d18a5c3a8da631242ffb7a078b","observation_id":"64f1b974-d02e-4101-94fd-3dffd045bb9c","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Complexbench- edit: Benchmarking complex instruction-driven image editing via compositional dependencies","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:d5e4c45f135ad7e6380456598e9a2c837c1932f0ca9f07c2003b2fb500cc3438","observation_id":"943159a4-f5fe-4b83-afc9-5487f10f4dc0","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.25541","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-03T09:17:48.633554Z","title":"Vision-zero: Scalable vlm self-improvement via strategic gamified self-play","venue":null,"work_id":"f509f6eb-9616-4acd-8858-7db61ce5ea75","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:1f7c59a19ea5ff8242cd9b2ff4d9645e6be27d6f58c7576dc245ed5b6ba0fa6c","observation_id":"7051ca2b-8520-47cb-8d28-993836afa6c1","resolution":{"observed_at":"2026-06-28T20:32:37.594412Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03681","last_updated":"2024-06-14T21:10:32Z","snapshot_observed_at":"2026-08-02T19:29:16.535750Z","submitted_at":"2024-02-06T04:06:06Z","title":"RL-VLM-F: Reinforcement Learning from Vision Language Foundation Model Feedback","version":4},"cited_work":{"arxiv_id":"2402.03681","doi":"10.48550/arxiv.2402.03681","metadata_source":"pith","pith_arxiv_id":"2402.03681","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"RL-VLM-F: Reinforcement learn- ing from vision language foundation model feedback","venue":"cs.RO","work_id":"153aaaf7-64d1-4be4-9cff-b24aee0b45a4","year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2402.03681","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:00ee9c9c20a439a4c6e7ed756b482d26e7cfb6b776f4b30522c2a9b014b6ca6e","observation_id":"2e8cf5b5-b2c5-4f1d-8830-fa282443f118","resolution":{"observed_at":"2026-06-28T20:32:37.635642Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Bovik, H.R","venue":null,"work_id":null,"year":2004},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3067ca32c97f286f9bb55ea83162b0bfd3e251c1a50848bd9766f57054123a1c","observation_id":"5e0e43ca-60cd-4b01-b9cb-452d3a44a720","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Objectdrop: Bootstrapping counterfactuals for photorealistic object removal and insertion","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:835ebba276cb1f0f37a3bbefc210f76745aab4d397437e0e738fc98cfb16fb9f","observation_id":"eca44017-6cc8-405d-8da2-86a39b58da44","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Qwen-image technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3ad3bcad7deee208bbaf68c7acc009cdab8866c5e68807fb978f174419d95a05","observation_id":"e0daf566-a14a-4547-abf1-a514fac9b991","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2509.26346","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-04T12:59:52.698229Z","title":"Editreward: A human- aligned reward model for instruction-guided image editing","venue":null,"work_id":"44f2e6b9-ba11-41a2-9c4f-aee7a3bc1178","year":2026},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:12af8e129c92ecf93425d4dda461a174bc75b87e2b0876957215e42198a2f1b9","observation_id":"b32365dc-e81c-499a-a505-7193463bb919","resolution":{"observed_at":"2026-06-28T20:32:37.638557Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"React: Synergizing reasoning and acting in language models","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:69c87f037aec17ebabc15ee28dc10523586634c7ddca73255de1105e60879bdf","observation_id":"acb9bdfe-6928-4161-a934-ce43389215c4","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.20275","last_updated":"2025-05-26T17:53:33Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-26T17:53:33Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","version":1},"cited_work":{"arxiv_id":"2505.20275","doi":null,"metadata_source":"pith","pith_arxiv_id":"2505.20275","snapshot_observed_at":"2026-07-10T13:27:05.927875Z","title":"ImgEdit: A Unified Image Editing Dataset and Benchmark","venue":"cs.CV","work_id":"059b5c3a-404c-4d30-a631-68c1d88a08a7","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2505.20275","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:c25a7286aca1df17b2435468a6d4531f4e85697dc5a92d14a80efe672f409ff2","observation_id":"863e4de5-27e8-434e-9e9a-191edcde9aa8","resolution":{"observed_at":"2026-06-28T20:32:37.625426Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Anyedit: Mastering unified high-quality image editing for any idea","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:ab693a0972738b6c71c640da0e406cbe3b34921f932571cbe7defb8256be68f3","observation_id":"d931bd3b-53a6-468d-a5ba-f661a2d442a2","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.03605","last_updated":"2022-07-11T10:30:29Z","snapshot_observed_at":"2026-08-04T22:53:41.491205Z","submitted_at":"2022-03-07T18:55:26Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","version":4},"cited_work":{"arxiv_id":"2203.03605","doi":"10.48550/arxiv.2203.03605","metadata_source":"pith","pith_arxiv_id":"2203.03605","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"DINO: DETR with Improved DeNoising Anchor Boxes for End-to-End Object Detection","venue":"cs.CV","work_id":"4e842f69-fa99-4dde-b8a7-b5a558d4c80b","year":2022},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2203.03605","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:e3f5f30549b7612c2d1aefdc25f00deaaeb45414efe4816bdb0b19e86fbedcee","observation_id":"bfefa1cb-fe27-4314-a419-da95a3ef4647","resolution":{"observed_at":"2026-06-28T20:32:37.626980Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Vision-language models for vision tasks: A survey.IEEE transactions on pattern analysis and machine intelligence, 46(8):5625– 5644, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3fa0f587e6e90b2023182fe99173cebad1c7e7e821f96de69a76689b0736d061","observation_id":"079f2189-e95c-49f9-8bac-d5f2eec0faa6","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Magicbrush: A manually annotated dataset for instruction-guided image editing.Advances in Neural Information Processing Systems, 36:31428–31449, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3549cfcd3f579aae997dd4f77b477f17b8672df9b49f889e1fb2d0b73beb5b3d","observation_id":"e2b98b3f-ffc6-4f57-a12d-c0456a1a199a","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Adaptive dynamic dehaz- ing via instruction-driven and task-feedback closed-loop optimization for diverse downstream task adaptation","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:23d7768b010579d731c454b2dcc2d262c167522320cac196637675a17c9cd5cd","observation_id":"0989cb2d-5660-45c2-b3b4-2ead59c4e062","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.20690","last_updated":"2025-09-23T02:34:36Z","snapshot_observed_at":"2026-08-05T06:11:45.068217Z","submitted_at":"2025-04-29T12:14:47Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","version":3},"cited_work":{"arxiv_id":"2504.20690","doi":"10.48550/arxiv.2504.20690","metadata_source":"pith","pith_arxiv_id":"2504.20690","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"In-Context Edit: Enabling Instructional Image Editing with In-Context Generation in Large Scale Diffusion Transformer","venue":"cs.CV","work_id":"8cafd680-1279-4695-8156-9079db325469","year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"cited_paper":"/paper/2504.20690","citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:5ad82bfada9292dea46d5685f3d85aa60989414555916e88f27b1debf6db4bf7","observation_id":"f9f4904c-77f9-45da-89c7-6ed3c42d4baf","resolution":{"observed_at":"2026-06-28T20:32:37.601901Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Deep loss convexification for learning iterative models.IEEE Transactions on Pattern Analysis and Machine Intelligence, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:36924732795a099bbc54ef13d7ab7aa2a09d1baf21a6047dd929357d1949ff31","observation_id":"7540c8b9-58ca-48ce-811f-e2c659fe9c0c","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Self-prompt guided image outpainting model for captions absence in social scenes.IEEE Transactions on Computational Social Systems, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:37519e75c67a5be44dab8369e1a469d389fd3429374879debbdadd69737add56","observation_id":"d3e744b4-cc23-40f5-b0ff-c5c8da2f4587","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Ultraedit: Instruction-based fine-grained image editing at scale.Advances in Neural Information Processing Systems, 37:3058–3093, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:a9bbc8d94386ba4234613e390288fe4ff3bd1a0e8b3f567b4ab32ae2c2464611","observation_id":"d573db7a-98a5-455c-b2a9-9115137f7830","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Challenges in trustworthy human evaluation of chatbots","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:3443d5631b567d3171de5e3c00880b63e9d527a49173130627d4f97a7ba2f4cd","observation_id":"6213505a-5891-46d0-a4e3-12fa2983252e","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"A review of convolutional neural networks in computer vision.Artificial Intelligence Review, 57(4):99, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:76d60b98668885f7a1062791ff85b4dc0809b9dde512a78c91be51910c539723","observation_id":"636f1204-e66d-4ec5-bdd4-3136c61f0700","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Judging llm-as-a-judge with mt-bench and chatbot arena.Advances in neural information processing systems, 36:46595–46623, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:953e72f4e4e35c5668b0b3117cbee51cdb1c688725c089d7c9d5aedb07b39cde","observation_id":"44ce27e2-2fe3-4a29-8341-7b2da23c46c2","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"Low-light image enhancement via generative perceptual priors","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:0b89e4f073c423f8e3ffc5d7a03331abf4e218beb1a97b37f5f34b9992021060","observation_id":"5be957f8-f381-47ae-b62b-53f47693e9a6","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-06-28T18:36:46.381564Z","title":"slightly more surprised, less neutral","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-06-28T18:36:46.381564Z"},"links":{"citing_paper":"/paper/2606.00931"},"observation_digest":"sha256:5a16149e4228b1289d676d80202474ccc52b95c03e707ff145fde687e85de9b8","observation_id":"6ebeb58e-1e7f-423f-b78a-38d7dd412a5d","resolution":{"observed_at":"2026-06-28T18:36:46.381564Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2606.00931","last_updated":"2026-05-30T23:37:55Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-01T00:57:33.201756Z","submitted_at":"2026-05-30T23:37:55Z","title":"CV-Arena: An Open Benchmark for Instructional Computer Vision Problem Solving with Human-AI Collaborative Preferences"},"reference_resolution":{"displayed":90,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":60,"verified_exact":30,"verified_fuzzy":0},"total_outbound_references":90},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 90 of 90 outbound references and 0 inbound Pith citation observations for arXiv:2606.00931."}