{"as_of":"2026-08-20T15:35:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:6b7cfaaf82a221d445045abead9c645eed64950b407c5264f185b884cbce5572","coverage":[{"denominator":59,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":59,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T11:47:29.180762Z","state":"measured"},{"denominator":59,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":59,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-20T06:33:59.587034+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.19790/citation-record","integrity":"/paper/2607.19790/integrity","json":"/paper/2607.19790/citation-record.json","paper":"/paper/2607.19790"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:21.857897Z","title":"SPHINX: A synthetic environment for visual perception and reasoning","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:21.857897Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:f0c2d9b5f35321a246c351fb1fc53966efdea200b2f461d3e8e03d5941b15018","observation_id":"321e6055-520a-4719-b34d-b2d6c97c782f","resolution":{"observed_at":"2026-08-01T11:47:21.857897Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.13923","last_updated":"2025-02-19T18:00:14Z","snapshot_observed_at":"2026-08-14T04:17:22.593941Z","submitted_at":"2025-02-19T18:00:14Z","title":"Qwen2.5-VL Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.13923","snapshot_observed_at":"2026-08-01T11:47:22.029634Z","title":"Qwen2.5-VL technical report","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.029634Z"},"links":{"cited_paper":"/paper/2502.13923","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:e1c2dc28732f4c934dde8289819bc450581a41a9ade33608aabade6e3cd84c0e","observation_id":"3666ff3d-ed4c-4ab9-9e4c-ec44845280b3","resolution":{"observed_at":"2026-08-01T11:47:22.029634Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.19914","last_updated":"2025-06-09T07:49:32Z","snapshot_observed_at":"2026-08-07T16:09:17.796555Z","submitted_at":"2025-05-26T12:40:31Z","title":"Enigmata: Scaling Logical Reasoning in Large Language Models with Synthetic Verifiable Puzzles","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.19914","snapshot_observed_at":"2026-08-01T11:47:22.196088Z","title":"Enigmata: Scaling logical reasoning in large language models with synthetic verifiable puzzles.arXiv preprint arXiv:2505.19914, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.196088Z"},"links":{"cited_paper":"/paper/2505.19914","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:4d4b489e906c029733053bbb7dd4425d369e2cff52fffe5ef4277ca59ab077b6","observation_id":"a17f5b4a-f1e3-436d-a374-4a8f01d3145e","resolution":{"observed_at":"2026-08-01T11:47:22.196088Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.20330","last_updated":"2024-04-09T15:17:50Z","snapshot_observed_at":"2026-08-07T12:15:30.838846Z","submitted_at":"2024-03-29T17:59:34Z","title":"Are We on the Right Way for Evaluating Large Vision-Language Models?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.20330","snapshot_observed_at":"2026-08-01T11:47:22.325941Z","title":"Are we on the right way for evaluating large vision-language models?arXiv preprint arXiv:2403.20330, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.325941Z"},"links":{"cited_paper":"/paper/2403.20330","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:9de1917136fc1bff499b4f4543d1712df1527e75744636f9d890478f8107b2df","observation_id":"e831cd8b-5f64-4316-b892-d91a736961aa","resolution":{"observed_at":"2026-08-01T11:47:22.325941Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13315","last_updated":"2024-08-17T11:56:08Z","snapshot_observed_at":"2026-08-16T14:08:10.175594Z","submitted_at":"2024-03-20T05:37:24Z","title":"PuzzleVQA: Diagnosing Multimodal Reasoning Challenges of Language Models with Abstract Visual Patterns","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.13315","snapshot_observed_at":"2026-08-01T11:47:22.484880Z","title":"PuzzleVQA: Diagnosing multimodal reasoning challenges of language models with abstract visual patterns.arXiv preprint arXiv:2403.13315, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.484880Z"},"links":{"cited_paper":"/paper/2403.13315","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d2b116f6c31378004b673e2a093883054d3607051332c56d6e7b2a8a2716f352","observation_id":"a1fb70ef-eedd-4af2-8739-c04ccc6f6bc8","resolution":{"observed_at":"2026-08-01T11:47:22.484880Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:22.649103Z","title":"EmbSpatial-Bench: Benchmarking spatial understanding for embodied tasks with large vision-language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.649103Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:9ba7e732a37aa0f9dbb3655b42c1ef755aa8ee8bcc90ea2ae18281b33c5ad977","observation_id":"e6451f18-8527-4441-b907-6fd29eee97aa","resolution":{"observed_at":"2026-08-01T11:47:22.649103Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:22.815879Z","title":"VLMEvalKit: An open-source toolkit for evaluating large multi-modality models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.815879Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:fc38496919ca1f142cc3a6cd6fa250f6d3ac693b404f951be52980c615a227b8","observation_id":"53ec7949-035d-412e-a5af-11461813dd8d","resolution":{"observed_at":"2026-08-01T11:47:22.815879Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.23977","last_updated":"2025-05-29T20:08:36Z","snapshot_observed_at":"2026-08-14T07:15:40.007800Z","submitted_at":"2025-05-29T20:08:36Z","title":"VisualSphinx: Large-Scale Synthetic Vision Logic Puzzles for RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.23977","snapshot_observed_at":"2026-08-01T11:47:22.950972Z","title":"VisualSphinx: Large-scale synthetic vision logic puzzles for RL.arXiv preprint arXiv:2505.23977, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:22.950972Z"},"links":{"cited_paper":"/paper/2505.23977","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d5b3bb464522e73b630dccc66a6ccbc2aa41c3a793733b76b93e89a7b73bd583","observation_id":"59bf5ae8-c8e4-4525-b8fe-c177fce0c22b","resolution":{"observed_at":"2026-08-01T11:47:22.950972Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-08-20T02:50:01.167264Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-01T11:47:23.095760Z","title":"Smith, Wei-Chiu Ma, and Ranjay Krishna","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.095760Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d82683f2f5f7aae559bae5506906fb91378d0810d26927eab2070f94b091ab3e","observation_id":"fb24cba7-7b31-4c49-be5a-c6f5f1953e27","resolution":{"observed_at":"2026-08-01T11:47:23.095760Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:23.230236Z","title":"Embodied reasoning question answer (ERQA) benchmark","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.230236Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:e02f747f5a96217331deca359c39a2365ec02b6c2e678fc13dd614445b5e78d2","observation_id":"2b0ad36e-671a-4e8c-94dd-4bb7fa6bfe25","resolution":{"observed_at":"2026-08-01T11:47:23.230236Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:23.292929Z","title":"Composition-grounded data synthesis for visual reasoning.arXiv preprint arXiv:2510.15040, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.292929Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:16474be05b148928b3fb2ae6f3628750940cee33ea1a5a14d5730528f59abd65","observation_id":"4f3530d0-3950-4c78-b670-57dbc90f4ffa","resolution":{"observed_at":"2026-08-01T11:47:23.292929Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.04178","last_updated":"2025-06-05T02:21:52Z","snapshot_observed_at":"2026-08-17T02:17:22.510859Z","submitted_at":"2025-06-04T17:25:39Z","title":"OpenThoughts: Data Recipes for Reasoning Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.04178","snapshot_observed_at":"2026-08-01T11:47:23.423108Z","title":"OpenThoughts: Data recipes for reasoning models.arXiv preprint arXiv:2506.04178, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.423108Z"},"links":{"cited_paper":"/paper/2506.04178","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:86e2e67285bd7012285510495125f8ce0bbbadf28a98322da3e1e4b51b7b0f9e","observation_id":"141e940d-58ea-443e-9c67-19dc1834071c","resolution":{"observed_at":"2026-08-01T11:47:23.423108Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-08-15T12:33:55.451951Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-08-01T11:47:23.573664Z","title":"DeepSeek-R1: Incentivizing reasoning capability in LLMs via reinforcement learning.arXiv preprint arXiv:2501.12948, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.573664Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:08511d5e274e784a655fadf0b84f7af67e347479d158f6d20d2b555797fa0522","observation_id":"e7c1496b-f6de-44b3-b118-cf92ad9e5402","resolution":{"observed_at":"2026-08-01T11:47:23.573664Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.01577","last_updated":"2025-01-11T12:19:13Z","snapshot_observed_at":"2026-08-16T13:21:55.061121Z","submitted_at":"2024-09-03T03:23:00Z","title":"EvoChart: A Benchmark and a Self-Training Approach Towards Real-World Chart Understanding","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.01577","snapshot_observed_at":"2026-08-01T11:47:23.720752Z","title":"EvoChart: A benchmark and a self-training approach towards real-world chart understanding","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.720752Z"},"links":{"cited_paper":"/paper/2409.01577","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:cc00f8c0dd8e1ce6bd6bc08917a41eec24763c2a3181f40b5558f2db404051d1","observation_id":"652dcc87-3c1a-4d41-9f59-0eb9898f3885","resolution":{"observed_at":"2026-08-01T11:47:23.720752Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-16T02:03:48.252223Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-08-01T11:47:23.867456Z","title":"Vision- R1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:23.867456Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:546530ef520bb52bc9dae13d9217d4bb2273e5affdf29e1211610e7b893d17aa","observation_id":"886d6178-534d-45c1-b65b-a4dc27699917","resolution":{"observed_at":"2026-08-01T11:47:23.867456Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:24.011421Z","title":"Hudson and Christopher D","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.011421Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:a717bb999c00bd5f09ae8c4c49ee13391c22a5999be99659e361e3131af54b06","observation_id":"6c6f66fd-0791-48b4-9449-dc25c1be387a","resolution":{"observed_at":"2026-08-01T11:47:24.011421Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:24.170473Z","title":"Derpanis, Babak Taati, and Radek Grzeszczuk","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.170473Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:1b832d0abbbbaf008f0fcf7b7f4efa72ca56ec28a9d054e4b7cffacb6922c514","observation_id":"041995dd-775a-4187-87a0-be5a228ff0d4","resolution":{"observed_at":"2026-08-01T11:47:24.170473Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:24.349175Z","title":"Lawrence Zitnick, and Ross Girshick","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.349175Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d8441f02846a39ddb4bd069fecaabbbd66af2fa82766f511fdc5a6bb7f53eb82","observation_id":"eace3887-7081-4ef5-a5fc-32b87bd679a1","resolution":{"observed_at":"2026-08-01T11:47:24.349175Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.19205","last_updated":"2024-04-30T02:05:18Z","snapshot_observed_at":"2026-08-17T09:28:37.052265Z","submitted_at":"2024-04-30T02:05:18Z","title":"TableVQA-Bench: A Visual Question Answering Benchmark on Multiple Table Domains","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.19205","snapshot_observed_at":"2026-08-01T11:47:24.468658Z","title":"TableVQA-Bench: A visual question answering benchmark on multiple table domains.arXiv preprint arXiv:2404.19205, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.468658Z"},"links":{"cited_paper":"/paper/2404.19205","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:fc48226df9c3ccf2a7ca7ccbb318117f5d42b82648001a876c88058eaa1d41d8","observation_id":"b36120e9-967c-433a-929e-a93860990c36","resolution":{"observed_at":"2026-08-01T11:47:24.468658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:24.553141Z","title":"Truth in the few: High-value data selection for efficient multi-modal reasoning.arXiv preprint arXiv:2506.04755, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.553141Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:a394c07d14097b74886bed6b5cf90d4d46bd5defbc860afcb3f2e910265843f1","observation_id":"2cfc6284-3a9c-4a69-a9b6-5fefab123e99","resolution":{"observed_at":"2026-08-01T11:47:24.553141Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.24871","last_updated":"2025-06-05T05:13:46Z","snapshot_observed_at":"2026-08-18T17:13:47.373678Z","submitted_at":"2025-05-30T17:59:38Z","title":"MoDoMoDo: Multi-Domain Data Mixtures for Multimodal LLM Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.24871","snapshot_observed_at":"2026-08-01T11:47:24.668308Z","title":"MoDoMoDo: Multi-domain data mixtures for multimodal LLM reinforcement learning.arXiv preprint arXiv:2505.24871, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.668308Z"},"links":{"cited_paper":"/paper/2505.24871","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:8512c5605593439acc2a4878472cb528cfef4698cf59ad72550b698c24de9321","observation_id":"5caa1d1d-90d8-4143-9426-0394621fd17e","resolution":{"observed_at":"2026-08-01T11:47:24.668308Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-19T07:59:58.721057Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-08-01T11:47:24.777511Z","title":"Visual-RFT: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.777511Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:45e867f105d343e60c39d98822536e1345a98e46008113579a21c4d6bb47d312","observation_id":"28ff2ef6-090e-4df5-a6e5-eb57c1e34c4f","resolution":{"observed_at":"2026-08-01T11:47:24.777511Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.02255","last_updated":"2024-01-21T03:47:06Z","snapshot_observed_at":"2026-08-20T14:58:44.877503Z","submitted_at":"2023-10-03T17:57:24Z","title":"MathVista: Evaluating Mathematical Reasoning of Foundation Models in Visual Contexts","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.02255","snapshot_observed_at":"2026-08-01T11:47:24.880118Z","title":"MathVista: Evaluating mathematical reasoning of foundation models in visual contexts.arXiv preprint arXiv:2310.02255, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.880118Z"},"links":{"cited_paper":"/paper/2310.02255","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:96f2c8d683f5dba857b33f32952415b42efdacf1dd7eac78d56ed7f3d245969d","observation_id":"72515d47-5a7a-45cf-b024-d808d159876e","resolution":{"observed_at":"2026-08-01T11:47:24.880118Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.05506","last_updated":"2025-04-10T14:10:05Z","snapshot_observed_at":"2026-08-20T00:21:10.500581Z","submitted_at":"2025-04-07T21:05:06Z","title":"ChartQAPro: A More Diverse and Challenging Benchmark for Chart Question Answering","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.05506","snapshot_observed_at":"2026-08-01T11:47:24.977601Z","title":"ChartQAPro: A more diverse and challenging benchmark for chart question answering.arXiv preprint arXiv:2504.05506, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:24.977601Z"},"links":{"cited_paper":"/paper/2504.05506","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:a625eada386a3bb27213a7153a429d2f798c6286c3cf51474399e05cb29b5c1b","observation_id":"f9bbe934-2199-4c20-8eeb-c1dfb9c468a3","resolution":{"observed_at":"2026-08-01T11:47:24.977601Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07365","last_updated":"2025-04-15T14:22:45Z","snapshot_observed_at":"2026-08-13T20:16:31.803514Z","submitted_at":"2025-03-10T14:23:12Z","title":"MM-Eureka: Exploring the Frontiers of Multimodal Reasoning with Rule-based Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07365","snapshot_observed_at":"2026-08-01T11:47:25.109733Z","title":"MM-Eureka: Exploring the frontiers of multimodal reasoning with rule-based reinforcement learning.arXiv preprint arXiv:2503.07365, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.109733Z"},"links":{"cited_paper":"/paper/2503.07365","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d974acb0039bc5aa4e12892cd5bae3a1c834710f8b1bb49633b8797312b66061","observation_id":"a3b1d93c-aa97-4eb6-8738-e3ab016b5caf","resolution":{"observed_at":"2026-08-01T11:47:25.109733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2302.12066","last_updated":"2023-02-23T14:43:53Z","snapshot_observed_at":"2026-08-19T21:01:42.589163Z","submitted_at":"2023-02-23T14:43:53Z","title":"Teaching CLIP to Count to Ten","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2302.12066","snapshot_observed_at":"2026-08-01T11:47:25.245565Z","title":"Teaching CLIP to count to ten.arXiv preprint arXiv:2302.12066, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.245565Z"},"links":{"cited_paper":"/paper/2302.12066","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:9174101975b130c6760d92d4a6769f8da27ce1135719ccb4fedb30223b56629e","observation_id":"9b477d87-304a-4a48-8f9c-a964a55d4d88","resolution":{"observed_at":"2026-08-01T11:47:25.245565Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.07536","last_updated":"2025-03-11T03:32:59Z","snapshot_observed_at":"2026-08-18T16:51:32.000170Z","submitted_at":"2025-03-10T17:04:14Z","title":"LMM-R1: Empowering 3B LMMs with Strong Reasoning Abilities Through Two-Stage Rule-Based RL","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.07536","snapshot_observed_at":"2026-08-01T11:47:25.396712Z","title":"LMM-R1: Empowering 3b LMMs with strong reasoning abilities through two-stage rule-based RL.arXiv preprint arXiv:2503.07536, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.396712Z"},"links":{"cited_paper":"/paper/2503.07536","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:9e1e3a3bacb3d1a0d47405276b1234cc65e995c40487d99d2d9f561a81ad8c61","observation_id":"b647749a-606c-4e14-a3e8-a0d72cfbb42b","resolution":{"observed_at":"2026-08-01T11:47:25.396712Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:25.546114Z","title":"We-Math: Does your large multimodal model achieve human-like mathematical reasoning? InProceedings of the 63rd Annual Meeting of the Association for Computational Linguistics, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.546114Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:f226e34895a217911970561a6f283cd4d2f0a847d6eeedfd15660b0da6f60ee0","observation_id":"152ab05e-95eb-448d-8668-e4b5eabd59fd","resolution":{"observed_at":"2026-08-01T11:47:25.546114Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2604.04917","last_updated":"2026-06-18T15:34:46Z","snapshot_observed_at":"2026-08-11T18:23:10.166901Z","submitted_at":"2026-04-06T17:56:25Z","title":"Vero: An Open RL Recipe for General Visual Reasoning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2604.04917","snapshot_observed_at":"2026-08-01T11:47:25.740386Z","title":"Vero: An open RL recipe for general visual reasoning.arXiv preprint arXiv:2604.04917, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.740386Z"},"links":{"cited_paper":"/paper/2604.04917","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:8c7b956b7045a8ee81b06ffdd90af41e70b634e708e2ac9a105c2cb687ad201b","observation_id":"4402b3df-71fb-4359-b210-37b5950e1c81","resolution":{"observed_at":"2026-08-01T11:47:25.740386Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.03300","last_updated":"2024-04-27T15:25:53Z","snapshot_observed_at":"2026-08-06T14:58:42.911363Z","submitted_at":"2024-02-05T18:55:32Z","title":"DeepSeekMath: Pushing the Limits of Mathematical Reasoning in Open Language Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.03300","snapshot_observed_at":"2026-08-01T11:47:25.891265Z","title":"DeepSeek- Math: Pushing the limits of mathematical reasoning in open language models.arXiv preprint arXiv:2402.03300, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:25.891265Z"},"links":{"cited_paper":"/paper/2402.03300","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:dcb0bd63a97e2699b0b67ca3bc1486ceb6296d5d074c7ac04622925c39f13ec3","observation_id":"50a88d76-1de5-4863-adf5-8d7dbea322b6","resolution":{"observed_at":"2026-08-01T11:47:25.891265Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-14T23:38:19.973422Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-08-01T11:47:26.024291Z","title":"VLM-R1: A stable and generalizable R1-style large vision-language model.arXiv preprint arXiv:2504.07615, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.024291Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:a5f335aa367940b3b7eed620e74ef8694c3291f8066971111f9c754a31debf60","observation_id":"0e3ba484-1ff3-47ad-bb33-69b4695fd3bd","resolution":{"observed_at":"2026-08-01T11:47:26.024291Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15929","last_updated":"2025-05-29T17:59:14Z","snapshot_observed_at":"2026-08-18T02:08:59.765654Z","submitted_at":"2025-05-21T18:33:50Z","title":"PhyX: Does Your Model Have the \"Wits\" for Physical Reasoning?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15929","snapshot_observed_at":"2026-08-01T11:47:26.156753Z","title":"PhyX: Does your model have the wits for physical reasoning?arXiv preprint arXiv:2505.15929, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.156753Z"},"links":{"cited_paper":"/paper/2505.15929","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:ddf3815450fe4c6bfd1b596a98ba5e3948dc8a6abe59af8a9e8f41a8336c449d","observation_id":"ce460896-e6f5-4cb4-a343-8b5b2fdb2344","resolution":{"observed_at":"2026-08-01T11:47:26.156753Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10342","last_updated":"2025-04-30T14:45:01Z","snapshot_observed_at":"2026-08-20T14:55:32.873899Z","submitted_at":"2025-04-14T15:50:39Z","title":"VisualPuzzles: Decoupling Multimodal Reasoning Evaluation from Domain Knowledge","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10342","snapshot_observed_at":"2026-08-01T11:47:26.293957Z","title":"VisualPuz- zles: Decoupling multimodal reasoning evaluation from domain knowledge.arXiv preprint arXiv:2504.10342, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.293957Z"},"links":{"cited_paper":"/paper/2504.10342","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:c7387b95a9cc28d5297c50c09a473e348043b11b53d2655369b97dc08c6a3897","observation_id":"ca6f6a0e-2630-43d9-9ccf-325d95d6ef81","resolution":{"observed_at":"2026-08-01T11:47:26.293957Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:26.427098Z","title":"Reasoning Gym: Reasoning environments for reinforcement learning with verifiable rewards.arXiv preprint arXiv:2505.24760, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.427098Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:95b624063cdcab32b3b4a18b86355e1eb38ff9d3b850706df29c81a9122a2d07","observation_id":"7606f5b9-7f60-4e0d-9fcd-5addc7a25a30","resolution":{"observed_at":"2026-08-01T11:47:26.427098Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:26.560618Z","title":"DeepVision-103K: A visually diverse, broad-coverage, and verifiable mathematical dataset for multimodal reasoning.arXiv preprint arXiv:2602.16742, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.560618Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:85b3bf72a739ed98fbe75002f2fb99fe9bdea81b63902ac678f6851a7c3cfd28","observation_id":"e6520cc1-8980-4761-8baa-842a387896f9","resolution":{"observed_at":"2026-08-01T11:47:26.560618Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.06585","last_updated":"2025-09-09T04:46:37Z","snapshot_observed_at":"2026-08-16T10:42:52.690576Z","submitted_at":"2025-08-08T04:23:04Z","title":"CountQA: How Well Do MLLMs Count in the Wild?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.06585","snapshot_observed_at":"2026-08-01T11:47:26.652739Z","title":"CountQA: How well do MLLMs count in the wild?arXiv preprint arXiv:2508.06585, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.652739Z"},"links":{"cited_paper":"/paper/2508.06585","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d20bd342a030ab018b5b1610f01cc78d9f2a5b016d86f0554a08343da9259161","observation_id":"ec01bcf0-49c8-4923-bc8d-2df490edd88c","resolution":{"observed_at":"2026-08-01T11:47:26.652739Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:26.744210Z","title":"Reason-RFT: Reinforcement fine-tuning for visual reasoning of vision language models.arXiv preprint arXiv:2503.20752, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.744210Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:c41af344306b29245a60b85de7ec0eeb559e7e968a5455d4c9d843135f58ee33","observation_id":"4fbe2944-d714-4d0a-98aa-fc9554dcc30e","resolution":{"observed_at":"2026-08-01T11:47:26.744210Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:26.848187Z","title":"Game-RL: Synthesizing multimodal verifiable game data to boost VLMs’ general reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.848187Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d494a27a6a8084a36d9099a1e3c300bfa85eeedb82428dfba5c41baeaf10bdd3","observation_id":"e8d32674-ab7e-4ba7-b209-dad1ac92859d","resolution":{"observed_at":"2026-08-01T11:47:26.848187Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.16860","last_updated":"2024-12-04T17:57:32Z","snapshot_observed_at":"2026-08-20T02:58:52.302783Z","submitted_at":"2024-06-24T17:59:42Z","title":"Cambrian-1: A Fully Open, Vision-Centric Exploration of Multimodal LLMs","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.16860","snapshot_observed_at":"2026-08-01T11:47:27.046319Z","title":"Cambrian-1: A fully open, vision-centric exploration of multimodal LLMs.arXiv preprint arXiv:2406.16860, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.046319Z"},"links":{"cited_paper":"/paper/2406.16860","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:d6f96d4173cd291f0f88a3c0b2f13e3a557f7a1171a4b388be226f7ce704d270","observation_id":"6d92f285-1413-4787-a8e2-f3df1ee96136","resolution":{"observed_at":"2026-08-01T11:47:27.046319Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:27.159658Z","title":"Traceable evidence enhanced visual grounded reasoning: Evaluation and methodology.arXiv preprint arXiv:2507.07999, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.159658Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:5e9a36d9be384f78065cf5240f8c6c480f399bb8a07141bcb38428de4327cb56","observation_id":"45a41f2a-3ca6-48b4-a9d4-0aecbea4f3c1","resolution":{"observed_at":"2026-08-01T11:47:27.159658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2402.14804","last_updated":"2024-02-22T18:56:38Z","snapshot_observed_at":"2026-08-13T01:56:18.092262Z","submitted_at":"2024-02-22T18:56:38Z","title":"Measuring Multimodal Mathematical Reasoning with MATH-Vision Dataset","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2402.14804","snapshot_observed_at":"2026-08-01T11:47:27.252449Z","title":"Mea- suring multimodal mathematical reasoning with MATH-Vision dataset.arXiv preprint arXiv:2402.14804, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.252449Z"},"links":{"cited_paper":"/paper/2402.14804","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:fe41d3be9bac76ce4d1823caadc94812ba3b13e12d75ed6735148ea11e82ff45","observation_id":"fb550949-b86a-4754-b52e-ddb6301c20ae","resolution":{"observed_at":"2026-08-01T11:47:27.252449Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:27.327542Z","title":"SpatialViz-Bench: A cognitively-grounded benchmark for diagnosing spatial visualization in MLLMs.arXiv preprint arXiv:2507.07610, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.327542Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:e833a77d3c205d0fca0486e8f49145a34610e06e9a43b4ea3b6dbfe0c3efa7dc","observation_id":"8986824e-c1f5-4f54-80b3-eae977c27c63","resolution":{"observed_at":"2026-08-01T11:47:27.327542Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.10128","last_updated":"2025-06-11T19:16:54Z","snapshot_observed_at":"2026-08-16T05:21:00.781496Z","submitted_at":"2025-06-11T19:16:54Z","title":"ViCrit: A Verifiable Reinforcement Learning Proxy Task for Visual Perception in VLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.10128","snapshot_observed_at":"2026-08-01T11:47:27.425487Z","title":"ViCrit: A verifiable reinforcement learning proxy task for visual perception in VLMs.arXiv preprint arXiv:2506.10128, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.425487Z"},"links":{"cited_paper":"/paper/2506.10128","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:8e06f1f5efbb2aa30b5c8a22e88e59ce89c20d1c7c43a71f761904df2ab3358f","observation_id":"5d28c6f6-f5b3-443a-99e4-67578dd105ef","resolution":{"observed_at":"2026-08-01T11:47:27.425487Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07934","last_updated":"2025-05-30T15:53:16Z","snapshot_observed_at":"2026-08-18T15:38:17.639385Z","submitted_at":"2025-04-10T17:49:05Z","title":"SoTA with Less: MCTS-Guided Sample Selection for Data-Efficient Visual Reasoning Self-Improvement","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07934","snapshot_observed_at":"2026-08-01T11:47:27.535628Z","title":"SoTA with less: MCTS-guided sample selection for data-efficient visual reasoning self-improvement.arXiv preprint arXiv:2504.07934, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.535628Z"},"links":{"cited_paper":"/paper/2504.07934","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:880b576fde9a3ebe091f59dc80aa2519367287716ea0a146dc2a69b2a9e5889e","observation_id":"bf766f73-9c7e-47ba-8f1b-5d285e2986d9","resolution":{"observed_at":"2026-08-01T11:47:27.535628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:27.697096Z","title":"Blaschko","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.697096Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:826f19c08bca926386a698a0f5c2c6373220375fdf508a5edaa73fac9adfd4b2","observation_id":"9442670b-fe8a-4e9a-af9b-e7838616f903","resolution":{"observed_at":"2026-08-01T11:47:27.697096Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.18521","last_updated":"2024-06-26T17:50:11Z","snapshot_observed_at":"2026-08-16T13:39:20.937460Z","submitted_at":"2024-06-26T17:50:11Z","title":"CharXiv: Charting Gaps in Realistic Chart Understanding in Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.18521","snapshot_observed_at":"2026-08-01T11:47:27.812458Z","title":"CharXiv: Charting gaps in realistic chart understanding in multimodal LLMs.arXiv preprint arXiv:2406.18521, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.812458Z"},"links":{"cited_paper":"/paper/2406.18521","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:ce26fb77d6d246b185781f14e0dbca061f215b14d88627980a7166c74fc5986a","observation_id":"b4bccc1e-36c1-44a6-a9ab-e0d217c2e645","resolution":{"observed_at":"2026-08-01T11:47:27.812458Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.02096","last_updated":"2025-06-02T17:45:16Z","snapshot_observed_at":"2026-08-16T21:01:21.497825Z","submitted_at":"2025-06-02T17:45:16Z","title":"SynthRL: Scaling Visual Reasoning with Verifiable Data Synthesis","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.02096","snapshot_observed_at":"2026-08-01T11:47:27.883967Z","title":"SynthRL: Scaling visual reasoning with verifiable data synthesis.arXiv preprint arXiv:2506.02096, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.883967Z"},"links":{"cited_paper":"/paper/2506.02096","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:7ee4a0618a5caca349ac3ad643137827064fe98345cc4f0388e41bb20d40133d","observation_id":"d658f3bf-0e1d-456a-b0ec-cbf42d7578a0","resolution":{"observed_at":"2026-08-01T11:47:27.883967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:27.981485Z","title":"RealWorldQA","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:27.981485Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:027fc8b5d6c7f1e2d268f527f83e27687eeaa9099f63a113248a8ecc855f6890","observation_id":"982adcee-b63c-4185-9dea-9853744bd561","resolution":{"observed_at":"2026-08-01T11:47:27.981485Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.04973","last_updated":"2024-07-06T06:48:16Z","snapshot_observed_at":"2026-07-06T18:42:18.289966Z","submitted_at":"2024-07-06T06:48:16Z","title":"LogicVista: Multimodal LLM Logical Reasoning Benchmark in Visual Contexts","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.04973","snapshot_observed_at":"2026-08-01T11:47:28.056919Z","title":"LogicVista: Multimodal LLM logical reasoning benchmark in visual contexts.arXiv preprint arXiv:2407.04973, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.056919Z"},"links":{"cited_paper":"/paper/2407.04973","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:1ce3d789a51291c1c9a1659c3c2123c538ea0d5c0d07bd30f75bd8f1e61798c4","observation_id":"8200ef4e-1116-4813-bca9-cb034b6a2368","resolution":{"observed_at":"2026-08-01T11:47:28.056919Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.07905","last_updated":"2025-06-09T16:20:54Z","snapshot_observed_at":"2026-08-17T18:35:49.211491Z","submitted_at":"2025-06-09T16:20:54Z","title":"WeThink: Toward General-purpose Vision-Language Reasoning via Reinforcement Learning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.07905","snapshot_observed_at":"2026-08-01T11:47:28.164827Z","title":"WeThink: Toward general-purpose vision-language reasoning via reinforcement learn- ing.arXiv preprint arXiv:2506.07905, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.164827Z"},"links":{"cited_paper":"/paper/2506.07905","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:848865f7a623c2952978cd0911c8e2847464d16297dd5270984cdb10fda6eead","observation_id":"a38f450c-7479-419e-a93a-2d14d92ed709","resolution":{"observed_at":"2026-08-01T11:47:28.164827Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.01599","last_updated":"2026-06-01T02:52:49Z","snapshot_observed_at":"2026-08-17T02:22:31.612463Z","submitted_at":"2026-06-01T02:52:49Z","title":"TRON: Targeted Rule-Verifiable Online Environments for Visual Reasoning RL","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.01599","snapshot_observed_at":"2026-08-01T11:47:28.286163Z","title":"TRON: Targeted rule-verifiable online environments for visual reasoning RL.arXiv preprint arXiv:2606.01599, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.286163Z"},"links":{"cited_paper":"/paper/2606.01599","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:f95cb98a92a1c39fbd71ee5aa76e6ef9e42dbfceec1ae9203d24061dd3d77ea9","observation_id":"0bcc56c5-31bd-4bf5-af0d-8d448254617c","resolution":{"observed_at":"2026-08-01T11:47:28.286163Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.10615","last_updated":"2025-03-18T08:52:34Z","snapshot_observed_at":"2026-08-15T09:44:57.157415Z","submitted_at":"2025-03-13T17:56:05Z","title":"R1-Onevision: Advancing Generalized Multimodal Reasoning through Cross-Modal Formalization","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.10615","snapshot_observed_at":"2026-08-01T11:47:28.392380Z","title":"R1- Onevision: Advancing generalized multimodal reasoning through cross-modal formalization","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.392380Z"},"links":{"cited_paper":"/paper/2503.10615","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:afa4a8eaeeec28f9c14fbd4bd81b23a76a4f8a8a82cb5a7aa3a569ffbfb5cca7","observation_id":"06628b5c-4a62-4556-80de-50f448c77ed3","resolution":{"observed_at":"2026-08-01T11:47:28.392380Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2606.06538","last_updated":"2026-06-04T01:11:21Z","snapshot_observed_at":"2026-08-16T05:49:13.707703Z","submitted_at":"2026-06-04T01:11:21Z","title":"WorldBench: A Challenging and Visually Diverse Multimodal Reasoning Benchmark","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2606.06538","snapshot_observed_at":"2026-08-01T11:47:28.553275Z","title":"Worldbench: A challenging and visually diverse multimodal reasoning benchmark.arXiv preprint arXiv:2606.06538, 2026","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.553275Z"},"links":{"cited_paper":"/paper/2606.06538","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:5e188b3d083f71afdc693b7862de4257f29b9ba5a300be45d3cf17561e2870f4","observation_id":"12823ab1-fbfe-4e24-b384-51cd57eeed34","resolution":{"observed_at":"2026-08-01T11:47:28.553275Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.21327","last_updated":"2025-05-27T15:23:23Z","snapshot_observed_at":"2026-08-20T06:11:48.391709Z","submitted_at":"2025-05-27T15:23:23Z","title":"MME-Reasoning: A Comprehensive Benchmark for Logical Reasoning in MLLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.21327","snapshot_observed_at":"2026-08-01T11:47:28.673571Z","title":"MME-Reasoning: A comprehensive benchmark for logical reasoning in MLLMs.arXiv preprint arXiv:2505.21327, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.673571Z"},"links":{"cited_paper":"/paper/2505.21327","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:b3a87b18c839139deb429e0f0e24fd7469f9ddb54bfd0c625f964e91198de1c6","observation_id":"e9db77c4-c4b4-4367-b9ce-fa6413821832","resolution":{"observed_at":"2026-08-01T11:47:28.673571Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.02813","last_updated":"2025-05-22T08:22:02Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-04T15:31:26Z","title":"MMMU-Pro: A More Robust Multi-discipline Multimodal Understanding Benchmark","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.02813","snapshot_observed_at":"2026-08-01T11:47:28.785230Z","title":"MMMU- Pro: A more robust multi-discipline multimodal understanding benchmark.arXiv preprint arXiv:2409.02813, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.785230Z"},"links":{"cited_paper":"/paper/2409.02813","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:8c328fd87f26481ef87600c89f4dd6e5519f7b4b1e35971621399059cd47b9ba","observation_id":"18c75216-e092-4c20-b998-cb3ea5b7b8a5","resolution":{"observed_at":"2026-08-01T11:47:28.785230Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i33.40039","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Xing, and Zhiting Hu","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"48668a12-589f-46be-9246-ba7d295a6cba","year":2026},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:28.924987Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:e36f0563b1b7643248f3abd7e812bbb24a0c58aab219a8d224aa91dc79e7be52","observation_id":"8bb04209-2a80-47a3-8067-4b8e91a10313","resolution":{"observed_at":"2026-08-01T11:48:19.392604Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-20T06:33:59.587034+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2406.11775","last_updated":"2025-01-27T06:25:11Z","snapshot_observed_at":"2026-08-16T13:42:09.278592Z","submitted_at":"2024-06-17T17:32:42Z","title":"Task Me Anything","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.11775","snapshot_observed_at":"2026-08-01T11:47:29.045426Z","title":"Task me anything.arXiv preprint arXiv:2406.11775, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:29.045426Z"},"links":{"cited_paper":"/paper/2406.11775","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:f4e0dcab366564e57a98cc7d0f39a1a0fff969404f52770a11d6b286b8b4498d","observation_id":"1fff77ec-b775-4dbf-bb49-d764082b07b7","resolution":{"observed_at":"2026-08-01T11:47:29.045426Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.14624","last_updated":"2024-08-18T08:10:16Z","snapshot_observed_at":"2026-08-13T03:52:04.619847Z","submitted_at":"2024-03-21T17:59:50Z","title":"MathVerse: Does Your Multi-modal LLM Truly See the Diagrams in Visual Math Problems?","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.14624","snapshot_observed_at":"2026-08-01T11:47:29.180762Z","title":"S9W6\" through","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:29.180762Z"},"links":{"cited_paper":"/paper/2403.14624","citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:2a723eb18684fc1f6154e82243f1de90f8e4fa902c9de90d32dcfb54591fae50","observation_id":"7f8ef853-976f-44fb-9605-cccd4b3d12ff","resolution":{"observed_at":"2026-08-01T11:47:29.180762Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-01T11:47:26.938715Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning","version":1},"reference_index":2026,"source":"pdf_text","source_observed_at":"2026-08-01T11:47:26.938715Z"},"links":{"citing_paper":"/paper/2607.19790"},"observation_digest":"sha256:e54b7c13ef5e3c8ab9d7ee3ef85371acf3cae0306a5e0892c7def9a2a4e1458a","observation_id":"8da32b69-1d74-4955-b2a0-d1a1387db81e","resolution":{"observed_at":"2026-08-01T11:47:26.938715Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.19790","last_updated":"2026-07-22T06:17:57Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-15T18:56:56.907887Z","submitted_at":"2026-07-22T06:17:57Z","title":"Trace: A Taxonomy-Guided Environment for Multidomain Visual Reasoning"},"reference_resolution":{"displayed":59,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":57,"verified_exact":1,"verified_fuzzy":0},"total_outbound_references":59},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-20T06:33:59.587034+00:00","source":"crossref"},{"observed_at":"2026-08-20T06:33:54.927442+00:00","source":"retraction_watch"}],"thesis":"As of 20 August 2026, this Paper Citation Record lists 59 of 59 outbound references and 0 inbound Pith citation observations for arXiv:2607.19790."}