{"as_of":"2026-08-08T02:26:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:f5f49a1337411d964ad8ccfb8d6f2ef26bd57a99cd480bed64361798c90b2d34","coverage":[{"denominator":136,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:34:56.485538Z","state":"measured"},{"denominator":100,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":100,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2506.07643/citation-record","integrity":"/paper/2506.07643/integrity","json":"/paper/2506.07643/citation-record.json","paper":"/paper/2506.07643"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2404.14219","last_updated":"2024-08-30T21:17:17Z","snapshot_observed_at":"2026-07-06T18:03:47.096406Z","submitted_at":"2024-04-22T14:32:33Z","title":"Phi-3 Technical Report: A Highly Capable Language Model Locally on Your Phone","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.14219","snapshot_observed_at":"2026-08-07T05:34:56.127801Z","title":"Phi-3 technical report: A highly capable language model locally on your phone.arXiv preprint arXiv:2404.14219, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.127801Z"},"links":{"cited_paper":"/paper/2404.14219","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:4fa90f590e4e45af9590dfb4d3e7c82505853d8387f7929e6b4cb98be83f44fe","observation_id":"c9ca91f4-db87-41f0-9308-5317b565070e","resolution":{"observed_at":"2026-08-07T05:34:56.127801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.132663Z","title":"Tallyqa: Answering complex counting ques- tions","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.132663Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:9ffb023c677cd06d21e8e056c8a8670554935caa194fcf2c92f6251ed79f1a04","observation_id":"73fd8e3d-13fd-4bc5-91dd-16ced5c8517d","resolution":{"observed_at":"2026-08-07T05:34:56.132663Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:34:56.136278Z","title":"Qwen-vl: A frontier large vision- language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.136278Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:d21264faad14807e1534ccf42078766df48bbfbcc9f1b57573e9031addd084ea","observation_id":"843123ab-78cf-4147-84f2-f2d8413c7631","resolution":{"observed_at":"2026-08-07T05:34:56.136278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.140227Z","title":"Qwen2.5- vl technical report, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.140227Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b22df982c8bd2fb27c85ef4e58bfbb24f8398ebc0e00e8c1455cc4e22caa109f","observation_id":"af9a5cfc-9c79-4443-80c9-74e5fe85537e","resolution":{"observed_at":"2026-08-07T05:34:56.140227Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.144144Z","title":"Recognition-by-components: a theory of human image understanding","venue":null,"work_id":null,"year":1987},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.144144Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:f56a8bb98dd13c404b3dfefccf352a0f63eb9617cb4085a3a8a03c164b00a17b","observation_id":"66014a5f-486a-4ef1-92e2-077b1527a6a1","resolution":{"observed_at":"2026-08-07T05:34:56.144144Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.148080Z","title":"Scene perception: Detecting and judging objects undergoing relational violations","venue":null,"work_id":null,"year":1982},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.148080Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:140b480d0a17757c1d61a228fc914f1050867bd466df4982a97f7433b82b054e","observation_id":"6f78d3f8-944f-4c9a-9ef2-f66756f1db8b","resolution":{"observed_at":"2026-08-07T05:34:56.148080Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.151726Z","title":"From machine learning to machine reasoning","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.151726Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:766523f077bf935b79307af5b5b584e42494cc7332545822bfd4ba9acb6a57ae","observation_id":"621a401c-846a-4fd6-afa5-c5a7bb983f12","resolution":{"observed_at":"2026-08-07T05:34:56.151726Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.17297","last_updated":"2024-03-26T00:53:24Z","snapshot_observed_at":"2026-08-02T11:10:24.263044Z","submitted_at":"2024-03-26T00:53:24Z","title":"InternLM2 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.17297","snapshot_observed_at":"2026-08-07T05:34:56.155396Z","title":"Internlm2 technical report.arXiv preprint arXiv:2403.17297, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.155396Z"},"links":{"cited_paper":"/paper/2403.17297","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:8b01cc08b12a155e40620bbbaad67ce6107678340aab2cc339f6dd669872df09","observation_id":"cd08e4b6-ef5d-4ff9-8482-d8609d25b6ac","resolution":{"observed_at":"2026-08-07T05:34:56.155396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.159529Z","title":"Spa- tialvlm: Endowing vision-language models with spatial reasoning capabilities","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.159529Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:80cb0ad3a8c85bd074b67d3200881ab3e82f6db1e83655d5ec51c7157887f080","observation_id":"35021869-bf88-43f1-9460-cb3d2a0777e9","resolution":{"observed_at":"2026-08-07T05:34:56.159529Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.163039Z","title":"Scene graph generation with role-playing large language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.163039Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:1e7704fad3131d506b8dfb55672f91dbeb50857e0794acdc057d3a76ca8ab6eb","observation_id":"4f834ca1-588e-46b7-89c7-957a58a15f21","resolution":{"observed_at":"2026-08-07T05:34:56.163039Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.09478","last_updated":"2023-11-07T18:25:48Z","snapshot_observed_at":"2026-08-06T12:38:03.720232Z","submitted_at":"2023-10-14T03:22:07Z","title":"MiniGPT-v2: large language model as a unified interface for vision-language multi-task learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.09478","snapshot_observed_at":"2026-08-07T05:34:56.166607Z","title":"Minigpt-v2: large language model as a unified interface for vision-language multi-task learning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.166607Z"},"links":{"cited_paper":"/paper/2310.09478","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:7a16b4b45ebd4160c9fe49afdc0d3165952139cab8e7067a1c1ce622fd2fe27a","observation_id":"8358cc76-c7f8-4885-b7fb-332f9af45017","resolution":{"observed_at":"2026-08-07T05:34:56.166607Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-07T05:34:56.170431Z","title":"Shikra: Unleashing multimodal llm’s referential dialogue magic","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.170431Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:82630bfb7e38f745e8adf2cfd3d3e60b1263c4e532284fe1aa678d5d62a88da4","observation_id":"1fa95942-7b78-406d-8936-b133ca531c27","resolution":{"observed_at":"2026-08-07T05:34:56.170431Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.12793","last_updated":"2023-11-28T08:52:50Z","snapshot_observed_at":"2026-08-04T08:17:54.774738Z","submitted_at":"2023-11-21T18:58:11Z","title":"ShareGPT4V: Improving Large Multi-Modal Models with Better Captions","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.12793","snapshot_observed_at":"2026-08-07T05:34:56.174628Z","title":"Sharegpt4v: Improving large multi-modal models with better captions","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.174628Z"},"links":{"cited_paper":"/paper/2311.12793","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:6388389c756dbd12bf3a247e94894225dfd688e45907e80a6fbcafbeae0099ab","observation_id":"d244ef11-44d7-4702-b2a3-f7b510f15722","resolution":{"observed_at":"2026-08-07T05:34:56.174628Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.178591Z","title":"De- tect what you can: Detecting and representing ob- jects using holistic models and body parts","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.178591Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:641a1686d11b5c71656c09647077e3fb5d373de3d558ddee28fc0efe298ba991","observation_id":"8c5458fc-0d9c-488d-89e8-0b4b86bb8343","resolution":{"observed_at":"2026-08-07T05:34:56.178591Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.16821","last_updated":"2024-04-29T20:24:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-25T17:59:19Z","title":"How Far Are We to GPT-4V? Closing the Gap to Commercial Multimodal Models with Open-Source Suites","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.16821","snapshot_observed_at":"2026-08-07T05:34:56.182129Z","title":"How far are we to gpt-4v? closing the gap to commercial multi- modal models with open-source suites","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.182129Z"},"links":{"cited_paper":"/paper/2404.16821","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:f81fda386e66dc602147e1c89e48d4a5efba8f05591635cf72fa73e38e7b3828","observation_id":"f691a715-d436-4257-8bcd-78060c30bf35","resolution":{"observed_at":"2026-08-07T05:34:56.182129Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.185764Z","title":"Some contro- versial questions in phonological theory","venue":null,"work_id":null,"year":1965},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.185764Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:79abbfea3d82f61445bfe2ff779ae32a67ddb3cc2504b621bbb0d19770c47875","observation_id":"eef70ba1-f99b-4921-844d-63719bb87971","resolution":{"observed_at":"2026-08-07T05:34:56.185764Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.189572Z","title":"In- structblip: Towards general-purpose vision-language models with instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.189572Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e4f1f2332639f6f059865740c13f082a1b0c2165c22f64bc7f55738931502a4f","observation_id":"81756ea0-0dde-4d05-999f-575bd59ad68b","resolution":{"observed_at":"2026-08-07T05:34:56.189572Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2309.17425","last_updated":"2023-11-06T02:47:51Z","snapshot_observed_at":"2026-07-06T16:25:38.571377Z","submitted_at":"2023-09-29T17:37:29Z","title":"Data Filtering Networks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2309.17425","snapshot_observed_at":"2026-08-07T05:34:56.193696Z","title":"Data filtering networks","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.193696Z"},"links":{"cited_paper":"/paper/2309.17425","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e569d5a1ef2b9afabe38ab4bb812ae15d6d8cc5599364b8f522d7b16a1896074","observation_id":"58f543eb-c494-422b-adc3-d91eb5814d1d","resolution":{"observed_at":"2026-08-07T05:34:56.193696Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2404.12390","last_updated":"2024-07-03T08:44:45Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-04-18T17:59:54Z","title":"BLINK: Multimodal Large Language Models Can See but Not Perceive","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2404.12390","snapshot_observed_at":"2026-08-07T05:34:56.197159Z","title":"Blink: Multimodal large language models can see but not perceive.arXiv preprint arXiv:2404.12390, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.197159Z"},"links":{"cited_paper":"/paper/2404.12390","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e380e339d62a712f3a377b517a71bace01712394a5b19742bb1fbeb8e8ba327f","observation_id":"395a5a37-0c82-48f3-a1a5-3d79e44675ee","resolution":{"observed_at":"2026-08-07T05:34:56.197159Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.200921Z","title":"Datacomp: In search of the next generation of multimodal datasets","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.200921Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:66c6c0edc5c9fc28b3b9cd5dd5266d509f1188913ecc0c90058de78be1524a02","observation_id":"b73cc2f4-d977-494e-aa5a-28d386d440b8","resolution":{"observed_at":"2026-08-07T05:34:56.200921Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.204191Z","title":"Making the v in vqa matter: Elevating the role of image understand- ing in visual question answering","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.204191Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:6f7bfedfbec0c0d1e2819ba7046941e7f3dbc419fb673794904f4ddd3ee61237","observation_id":"d2d29edd-9cbb-4257-b5d7-93b45b8f30df","resolution":{"observed_at":"2026-08-07T05:34:56.204191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.207859Z","title":"Agqa: A benchmark for compo- sitional spatio-temporal reasoning","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.207859Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:a81b5f18a439616268f1b9f9b015a5327bd4944ad3688451e81da281036f7244","observation_id":"7fd1fe8b-843f-4466-af2e-9ff1de480b38","resolution":{"observed_at":"2026-08-07T05:34:56.207859Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.211197Z","title":"Lvis: A dataset for large vocabulary instance segmenta- tion","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.211197Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:0e804a9f3ad6015acbef32bb620491b46fe69e3744ec5229ba299d79c587a614","observation_id":"a66fd0b3-7f33-4b05-9ecc-14e3e9fb574f","resolution":{"observed_at":"2026-08-07T05:34:56.211197Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.214266Z","title":"Dsgg: Dense rela- tion transformer for an end-to-end scene graph gener- 10 ation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.214266Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:80a2d234ede92c08abe6ccd71131c7f7bcd23dc058dd5fb8c92f45005f046cf9","observation_id":"154f2970-d1c7-477c-93c8-ddc2a9d89bf3","resolution":{"observed_at":"2026-08-07T05:34:56.214266Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.217733Z","title":"Partim- agenet: A large, high-quality dataset of parts, 2022","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.217733Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:ea73f2852a56127eb496b05f62ff2673b72c1813cdaa63d52a6ff0f4bccb80dd","observation_id":"190fa380-8023-4ef3-bfb2-d265879ed3ef","resolution":{"observed_at":"2026-08-07T05:34:56.217733Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.221442Z","title":"The curious case of neural text degenera- tion, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.221442Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:23ac54b3b14adb5fe097e697f6e14f70d034df0dedc99954fd5827a9bd633b69","observation_id":"d507d362-1e83-4122-8850-e25e00a3b9dc","resolution":{"observed_at":"2026-08-07T05:34:56.221442Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.224704Z","title":"Sugarcrepe: Fixing hackable benchmarks for vision-language composi- tionality","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.224704Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:1830f8f6016626eb9c0709f7f4f4876ba2ff854b752df080079aacbd473ebe6e","observation_id":"a6b91b7f-3fb6-4f52-a138-ac68540b9a43","resolution":{"observed_at":"2026-08-07T05:34:56.224704Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.228027Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.228027Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:f310d0a6ecaf82ebfbfbc916d43050fc5f6d94c5c9d1deb09b32ec8c638e9e91","observation_id":"8653c0d0-3872-4fc3-b731-81a48967ace8","resolution":{"observed_at":"2026-08-07T05:34:56.228027Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.231437Z","title":"Compositionality decomposed: How do neural networks generalise? Journal of Artificial Intelligence Research, 67:757–795, 2020","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.231437Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:5e7de652611457559ca91fb3192111a4dc6afec18fc34fef432052920263d327","observation_id":"b55462a7-4705-4134-b514-5ab167e9c7af","resolution":{"observed_at":"2026-08-07T05:34:56.231437Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.234735Z","title":"Openclip, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.234735Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:f0aa2fe3aa381365e730777f42f00a75e00851ed54f6c283ae531d9aef8c11d9","observation_id":"38c3e5d5-f37f-422b-ab2c-fa3c6f24cdf9","resolution":{"observed_at":"2026-08-07T05:34:56.234735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.239075Z","title":"Composi- tionality","venue":null,"work_id":null,"year":1997},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.239075Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:429bcfcbaf6caa718217745b35dc64188cccf4b89fbd6fdf73bd5f277bea207e","observation_id":"5eb09afa-beb7-4308-8720-fc42fe779bdf","resolution":{"observed_at":"2026-08-07T05:34:56.239075Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.242711Z","title":"Action genome: Actions as compositions of spatio-temporal scene graphs","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.242711Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:5ba2f6d2793f0d11f426be57ce28f88b31e939eedf149a72a5d6114183682a64","observation_id":"e390da5c-37bf-4155-a1ff-cf3b648340c5","resolution":{"observed_at":"2026-08-07T05:34:56.242711Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.246134Z","title":"Dvqa: Understanding data visualiza- tions via question answering","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.246134Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:0e509b3cbb211f5bdd2eb3c4aab1edf88551886b89e9b9d9142c471e0bb99c00","observation_id":"e680ed8a-74b7-43bb-a857-0c7330884c8f","resolution":{"observed_at":"2026-08-07T05:34:56.246134Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.249666Z","title":"What’s “up” with vision-language models? inves- tigating their struggle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.249666Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:013ac7c903dfbee51a8810aec04efd3145601384edc9a08e4e67dca4397652ef","observation_id":"3637a4dc-3f5b-473d-ba09-dd7a31d99e13","resolution":{"observed_at":"2026-08-07T05:34:56.249666Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.19785","last_updated":"2023-10-30T17:50:15Z","snapshot_observed_at":"2026-07-06T16:40:39.567420Z","submitted_at":"2023-10-30T17:50:15Z","title":"What's \"up\" with vision-language models? Investigating their struggle with spatial reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.19785","snapshot_observed_at":"2026-08-07T05:34:56.253961Z","title":"What’s” up” with vision-language models? inves- tigating their struggle with spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.253961Z"},"links":{"cited_paper":"/paper/2310.19785","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:8f657381121a91b5f6ba9ed5b0f0bd29126822adcc1c4c850e0249b74f212027","observation_id":"95fe4f56-daef-4ca4-a7de-5b3962301881","resolution":{"observed_at":"2026-08-07T05:34:56.253961Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.258047Z","title":"A diagram is worth a dozen images","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.258047Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:2b02c737583c5b870e0471b1634b3b05e73bb9553bd5107166a7b4658e64948e","observation_id":"759036f5-8542-4cb1-bcc5-5065eaf3e1a7","resolution":{"observed_at":"2026-08-07T05:34:56.258047Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.261392Z","title":"Are you smarter than a sixth grader? textbook ques- tion answering for multimodal machine comprehen- sion","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.261392Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e38918d367dfa8281660c5c2c338de9b3711138092a021ec7bb7fe8e57e79dae","observation_id":"08a2d4fb-fef0-4c76-9bfc-27edab966a79","resolution":{"observed_at":"2026-08-07T05:34:56.261392Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.264742Z","title":"Llm4sgg: Large language models for weakly supervised scene graph generation","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.264742Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:9ffec515f24daf18a1fb575155f64c69529e98a5a797b91e9296e4c62df17f41","observation_id":"a6c30a0e-ed8d-4f06-b883-65e6aa4ccace","resolution":{"observed_at":"2026-08-07T05:34:56.264742Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.268064Z","title":"Segment anything","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.268064Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bd39d0b51b46ca190f283dc0a001593bfbeaead9ff7ca42e377c981ed61e848a","observation_id":"cb438b5b-3fed-4aa8-b934-e8b48cb7dc27","resolution":{"observed_at":"2026-08-07T05:34:56.268064Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.271522Z","title":"Vi- sual genome: Connecting language and vision using crowdsourced dense image annotations","venue":null,"work_id":null,"year":2017},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.271522Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:4d04b956b29121f1bf7e26fa06fc4deedf2440b3f1dc47cb65542548585c3fa7","observation_id":"a750bf21-1158-4bf8-a17b-7c2422b5bf1c","resolution":{"observed_at":"2026-08-07T05:34:56.271522Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.275008Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":null,"year":1956},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.275008Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:68ebf6e17a2a62c59eb3725c422163695bd0401497e80ff7f90f9b6a442656a1","observation_id":"be22b953-e045-4b7e-bea5-142f24c67f0e","resolution":{"observed_at":"2026-08-07T05:34:56.275008Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.278599Z","title":"Seed-bench: Benchmark- ing multimodal llms with generative comprehension,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.278599Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bdc3bb75f8d89544efd6ac16ff12b5150dccfd3d74ef539890a14b06f8bc03b3","observation_id":"7dcedcd2-9f0c-4a1e-8edc-af5cc08444e2","resolution":{"observed_at":"2026-08-07T05:34:56.278599Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2306.05425","last_updated":"2023-06-08T17:59:56Z","snapshot_observed_at":"2026-07-06T15:40:24.127663Z","submitted_at":"2023-06-08T17:59:56Z","title":"MIMIC-IT: Multi-Modal In-Context Instruction Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.05425","snapshot_observed_at":"2026-08-07T05:34:56.282191Z","title":"Mimic-it: Multi-modal in-context instruction tuning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.282191Z"},"links":{"cited_paper":"/paper/2306.05425","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:081eb8815b3f8e1a5103e3c5ee1f3e2f9d521324f962692cc3baa75b77c912aa","observation_id":"0a0653aa-0fc1-4e56-941e-561e8d0613b9","resolution":{"observed_at":"2026-08-07T05:34:56.282191Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.04767","last_updated":"2023-07-10T17:59:40Z","snapshot_observed_at":"2026-08-06T16:51:13.365740Z","submitted_at":"2023-07-10T17:59:40Z","title":"Semantic-SAM: Segment and Recognize Anything at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.04767","snapshot_observed_at":"2026-08-07T05:34:56.285746Z","title":"Semantic-sam: Segment and rec- ognize anything at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.285746Z"},"links":{"cited_paper":"/paper/2307.04767","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:1334e9a139600aa4ab28e175b20c15ef22c5a99963ad1e5642c79e0f98dba37b","observation_id":"c563c1f1-84d0-439a-8963-fdd760c74134","resolution":{"observed_at":"2026-08-07T05:34:56.285746Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.289546Z","title":"Sgtr: End-to-end scene graph generation with transformer,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.289546Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:17e39d695fccd42188543bd83d6fea1616fb7d43676cbf459edd205494e4ec4c","observation_id":"766c363b-2435-485a-9584-d459cccf1692","resolution":{"observed_at":"2026-08-07T05:34:56.289546Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.293393Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision- language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.293393Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:d1f19326c300cdbb5eb09aaa80c76a80440ea3b1f5553fa72f7174f4628154c8","observation_id":"6a265df5-0964-4b0b-b059-1afef75098d4","resolution":{"observed_at":"2026-08-07T05:34:56.293393Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.296832Z","title":"Vila: On pre- training for visual language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.296832Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bd8cd0e80a8cd59ee461f7ca0b13b61077e6e6df9b61463c99476ea2911edeed","observation_id":"635def2f-8e23-415f-9fc8-08656c6d96d6","resolution":{"observed_at":"2026-08-07T05:34:56.296832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.300186Z","title":"Microsoft coco: Common ob- jects in context","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.300186Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bd6dd18a139df18cb0aaab5106133d97e62cd424a8af129e8212a04d0348871a","observation_id":"c89f1ff3-2383-41d9-a704-350217b7092b","resolution":{"observed_at":"2026-08-07T05:34:56.300186Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.303622Z","title":"Gps-net: Graph property sensing net- work for scene graph generation","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.303622Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:052bc9282e8556126c5835df5fe4dd779c76b03b4adf1b136a09f8e04681eee5","observation_id":"1bbfaad7-dd63-4ff1-bb67-0ea68d42726e","resolution":{"observed_at":"2026-08-07T05:34:56.303622Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.307221Z","title":"Visual spatial reasoning","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.307221Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:63f1815ce9b35dcbf859ebe03b486ffebac0c59c29513ee8841b4e678f1292f9","observation_id":"f65d36ee-664b-42cb-9df9-cc0cc0047354","resolution":{"observed_at":"2026-08-07T05:34:56.307221Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.03744","last_updated":"2024-05-15T19:22:44Z","snapshot_observed_at":"2026-07-06T16:28:22.350574Z","submitted_at":"2023-10-05T17:59:56Z","title":"Improved Baselines with Visual Instruction Tuning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.03744","snapshot_observed_at":"2026-08-07T05:34:56.311317Z","title":"Improved baselines with visual instruction tun- ing","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.311317Z"},"links":{"cited_paper":"/paper/2310.03744","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:271d25ad30a7c0218f7e1f58b5805e9ca4e5c9c484f716b1b4252c4f5f7ad924","observation_id":"5e7f6793-a6dc-4679-aff5-253e0caae909","resolution":{"observed_at":"2026-08-07T05:34:56.311317Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.314772Z","title":"Visual instruction tuning","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.314772Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:2efecaaa7192885f4b2f4d8b892b902d46dc6c719b4d67bf8f23c1ec31105aab","observation_id":"15a46ba1-9ef2-446b-9248-f2b7ee21e784","resolution":{"observed_at":"2026-08-07T05:34:56.314772Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2307.06281","last_updated":"2024-08-20T03:56:03Z","snapshot_observed_at":"2026-07-06T15:53:19.485466Z","submitted_at":"2023-07-12T16:23:09Z","title":"MMBench: Is Your Multi-modal Model an All-around Player?","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2307.06281","snapshot_observed_at":"2026-08-07T05:34:56.318290Z","title":"Mmbench: Is your multi-modal model an all-around player? arXiv preprint arXiv:2307.06281, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.318290Z"},"links":{"cited_paper":"/paper/2307.06281","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:0733c4cc50e6b13d734510d146f3666584e1f4ed69d89828a4c143dfdccb03fb","observation_id":"70118e8b-c904-40d3-9813-714408d96a84","resolution":{"observed_at":"2026-08-07T05:34:56.318290Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.322396Z","title":"Visual relationship detection with lan- guage priors","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.322396Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bf428d6575bc32d3f60c853039449aea44793a03df1e7ad6b6f20ea7e9589ec3","observation_id":"1869da5b-7dd9-49ec-a545-6c6675d21df2","resolution":{"observed_at":"2026-08-07T05:34:56.322396Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.326676Z","title":"Groma: Localized visual tokeniza- tion for grounding multimodal large language models","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.326676Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:2a94f7f996a7472a63cb3a52c2888a56c468b118f0f8a6cc9c15f8cd1b0a5f5e","observation_id":"26960e45-f922-484b-b6c3-8607b1f17359","resolution":{"observed_at":"2026-08-07T05:34:56.326676Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.330051Z","title":"Crepe: Can vision-language foundation models reason compositionally? In Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, pages 10910–10921, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.330051Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b667452bcc2907c809e45125fb96c289acfd86e86164c61c8b94deb10374c2f2","observation_id":"e733bdb7-1ab0-4e90-8320-9be7a0267600","resolution":{"observed_at":"2026-08-07T05:34:56.330051Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.333507Z","title":"Generation and comprehension of unambigu- ous object descriptions","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.333507Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:92e86ce058cc0c64415c1491d3edc3faee59ec076d365b8e3f459ed0571c9706","observation_id":"31eff2e7-03e2-44ae-b24d-53656fde7692","resolution":{"observed_at":"2026-08-07T05:34:56.333507Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.337199Z","title":"Ok-vqa: A visual ques- tion answering benchmark requiring external knowl- edge","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.337199Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:64d42094ff17db151e619df44cba8bbc83f51d98f1d336da25a2676fafe7c1b2","observation_id":"5d3683ad-d4d0-4391-aef0-f33890610358","resolution":{"observed_at":"2026-08-07T05:34:56.337199Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2203.10244","last_updated":"2022-03-19T05:00:30Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2022-03-19T05:00:30Z","title":"ChartQA: A Benchmark for Question Answering about Charts with Visual and Logical Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2203.10244","snapshot_observed_at":"2026-08-07T05:34:56.340682Z","title":"Chartqa: A benchmark for question answering about charts with visual and logical reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.340682Z"},"links":{"cited_paper":"/paper/2203.10244","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:05c93d026f2fa43fa0b27f9b25bafa94c6167219616a17136793fd2648dccd2b","observation_id":"9ce88af0-17bb-4942-a2a3-475cb895b420","resolution":{"observed_at":"2026-08-07T05:34:56.340682Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.344278Z","title":"Docvqa: A dataset for vqa on document images","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.344278Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:c67e02dba7aaa4c2ee9137269d5872e49c48735dd9dace77d0cb191501c28202","observation_id":"fb224d5c-7609-41b4-aaa3-bcfa16c183f5","resolution":{"observed_at":"2026-08-07T05:34:56.344278Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.09611","last_updated":"2024-04-18T18:51:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-03-14T17:51:32Z","title":"MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.09611","snapshot_observed_at":"2026-08-07T05:34:56.348041Z","title":"Mm1: Methods, analysis & insights from multimodal llm pre-training","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.348041Z"},"links":{"cited_paper":"/paper/2403.09611","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:23310e9e38d7866f49abd0ffcc6880e5dc198622d512dc08739b6bd0d540d1f6","observation_id":"b38f56ce-fee3-45bf-a545-1ee82014b56b","resolution":{"observed_at":"2026-08-07T05:34:56.348041Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.351500Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.351500Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:876b90ac2382600263d395ae9d9b78235eb6066902abf19cfa56588a29103d60","observation_id":"b6949f4a-3c2e-4c82-a8a2-dcd9a9d65efd","resolution":{"observed_at":"2026-08-07T05:34:56.351500Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04837","last_updated":"2023-12-12T05:48:14Z","snapshot_observed_at":"2026-07-06T16:58:43.934362Z","submitted_at":"2023-12-08T05:23:50Z","title":"Localized Symbolic Knowledge Distillation for Visual Commonsense Models","version":2},"cited_work":{"arxiv_id":"2312.04837","doi":null,"metadata_source":"pith","pith_arxiv_id":"2312.04837","snapshot_observed_at":"2026-08-07T05:34:56.941430Z","title":"Localized Symbolic Knowledge Distillation for Visual Commonsense Models","venue":"cs.AI","work_id":"71d678a4-d59b-4737-a1bf-210901158b76","year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.355778Z"},"links":{"cited_paper":"/paper/2312.04837","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:a0daf00928a48964480c5fc1f77de6d2cfe43cf9731423b0e6937f55d2fe0aeb","observation_id":"97576187-3383-4a1d-926a-33255125e53c","resolution":{"observed_at":"2026-08-07T05:34:56.947759Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.14824","last_updated":"2023-07-13T05:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-06-26T16:32:47Z","title":"Kosmos-2: Grounding Multimodal Large Language Models to the World","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2306.14824","snapshot_observed_at":"2026-08-07T05:34:56.359405Z","title":"Kosmos-2: Grounding multimodal large 12 language models to the world","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.359405Z"},"links":{"cited_paper":"/paper/2306.14824","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:3bf94cc595969736d04b46d087a6e72e18f4f96e5522f5cbb5b35add75b1869d","observation_id":"fb21d42a-4bde-4359-b3ee-1eeef744921a","resolution":{"observed_at":"2026-08-07T05:34:56.359405Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.362597Z","title":"Plummer, Liwei Wang, Chris M","venue":null,"work_id":null,"year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.362597Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:2a0615592100c3fceea289942a8efa4270716413843ccefe60ea8bc8ef1ff77f","observation_id":"80ba8dee-bad6-40fe-9d86-df044fb927b7","resolution":{"observed_at":"2026-08-07T05:34:56.362597Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.366288Z","title":"Filtering, distillation, and hard negatives for vision-language pre-training","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.366288Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:331df6fdcfc049836ae80e6138451cbdd1c92d5cc7f840f7918c1dca47058d88","observation_id":"f6f9ad47-2c09-4d16-af02-02e7b913a977","resolution":{"observed_at":"2026-08-07T05:34:56.366288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.369936Z","title":"Ramesh, Gabriel Goh, Sandhini Agarwal, Girish Sas- try, Amanda Askell, Pamela Mishkin, Jack Clark, Gretchen Krueger, and Ilya Sutskever","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.369936Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:05688ecba67e2e35a2a335787c5a8e84ea4bbcf46bb7a46660a98d5448844cd2","observation_id":"1bdbdeca-8d3e-48e5-9c34-bf342391da66","resolution":{"observed_at":"2026-08-07T05:34:56.369936Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.373066Z","title":"Paco: Parts and attributes of common ob- jects","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.373066Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b37b20c51ef741d7c3808fe538fa0a38ae8e46ccfce76c98e7fbe990b4704831","observation_id":"a5049823-3312-44d8-b173-26fb24d6fac1","resolution":{"observed_at":"2026-08-07T05:34:56.373066Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03356","last_updated":"2024-06-02T00:33:53Z","snapshot_observed_at":"2026-08-08T00:57:25.976213Z","submitted_at":"2023-11-06T18:59:57Z","title":"GLaMM: Pixel Grounding Large Multimodal Model","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03356","snapshot_observed_at":"2026-08-07T05:34:56.376390Z","title":"Glamm: Pixel grounding large multimodal model","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.376390Z"},"links":{"cited_paper":"/paper/2311.03356","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:943f8fe9d41f54d740de5af757a2cd9cc9b15d6d62f2be4b84141635a1cc66f9","observation_id":"22d2aca9-be99-406e-815d-a7e7aa6b1e77","resolution":{"observed_at":"2026-08-07T05:34:56.376390Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.381288Z","title":"Deepspeed: System optimizations enable training deep learning models with over 100 billion parameters","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.381288Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:ee195e095bbfc95aa1575caa2df181d3336d90702a4c307a8a51c5228a395ad8","observation_id":"8c95e9ec-8b78-4775-bd19-2cbad3b59826","resolution":{"observed_at":"2026-08-07T05:34:56.381288Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T05:34:56.384658Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.384658Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:94c5891e3804183fe92ff5160b2930f11422c99fa93ba9abe1cafc588e169b3a","observation_id":"60fd5677-cd24-47eb-ae44-fc60fea3642e","resolution":{"observed_at":"2026-08-07T05:34:56.384658Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.388383Z","title":"Scienceqa: A novel resource for question answering on scholarly articles","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.388383Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b28237dc8c1db4713d58847e86e2b3cb8501708981cc56ef22659a243d5d60ba","observation_id":"99543457-7f41-4236-9855-6ac962b887b3","resolution":{"observed_at":"2026-08-07T05:34:56.388383Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2111.02114","last_updated":"2021-11-03T10:16:39Z","snapshot_observed_at":"2026-08-02T08:12:49.547570Z","submitted_at":"2021-11-03T10:16:39Z","title":"LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2111.02114","snapshot_observed_at":"2026-08-07T05:34:56.391967Z","title":"Laion-400m: Open dataset of clip- filtered 400 million image-text pairs","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.391967Z"},"links":{"cited_paper":"/paper/2111.02114","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b022d67d3049362c557c01e1c8195ddffc775fb483efdd3db65fbb22598693ec","observation_id":"2057fdbb-aa2b-4505-b9f1-b5910432c66d","resolution":{"observed_at":"2026-08-07T05:34:56.391967Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.395633Z","title":"A- okvqa: A benchmark for visual question answering using world knowledge","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.395633Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e8612b309b51e08265ba87e0c4ebe819871877d676e398184a392014b671ba5b","observation_id":"1431c41e-45dc-44f0-b397-12802c2e6d23","resolution":{"observed_at":"2026-08-07T05:34:56.395633Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.398911Z","title":"Textcaps: a dataset for image captioning with reading comprehension","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.398911Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:12ada5118a10b464700fe2e3ca6f49fc5d3c5d7ccb1e6b5d4ea24ecb483d8637","observation_id":"62c8d675-5ca3-418f-9b30-17d5781275cc","resolution":{"observed_at":"2026-08-07T05:34:56.398911Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.402470Z","title":"Learning to compose dynamic tree structures for visual contexts","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.402470Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:650dc3d8469ef03bae4daac232a41535054b4bfbc377e84d010e519fd4b219f2","observation_id":"932b6292-a847-48c3-bbbd-467b58400c35","resolution":{"observed_at":"2026-08-07T05:34:56.402470Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.405973Z","title":"Unbiased scene graph generation from biased training","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.405973Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:aad16d5821061dedda9bf6b338712e798b32aa76d7244d86a45b1001d3e34170","observation_id":"d0fea6cf-5322-4cb4-9a35-899011ecac55","resolution":{"observed_at":"2026-08-07T05:34:56.405973Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.14852","last_updated":"2024-11-04T21:51:07Z","snapshot_observed_at":"2026-08-06T02:17:38.157584Z","submitted_at":"2024-06-21T03:53:37Z","title":"Is A Picture Worth A Thousand Words? Delving Into Spatial Reasoning for Vision Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.14852","snapshot_observed_at":"2026-08-07T05:34:56.409537Z","title":"Is a picture worth a thousand words? delving into spatial rea- soning for vision language models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.409537Z"},"links":{"cited_paper":"/paper/2406.14852","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:f4e72a365ec5cee26f22ca2099988c94f6b0b90690dabbdb9df8cafd574afeed","observation_id":"36dcad90-d463-478d-9e41-baf1443bfe0c","resolution":{"observed_at":"2026-08-07T05:34:56.409537Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.03079","last_updated":"2024-02-04T08:23:04Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-11-06T13:04:39Z","title":"CogVLM: Visual Expert for Pretrained Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.03079","snapshot_observed_at":"2026-08-07T05:34:56.413258Z","title":"Cogvlm: Visual ex- pert for pretrained language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.413258Z"},"links":{"cited_paper":"/paper/2311.03079","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:1977ce25d767c499a1dc79fb990f5fe928f8315ffa51107cc9c73067f189c450","observation_id":"5b104c79-3288-4e23-94d8-f6495d894c86","resolution":{"observed_at":"2026-08-07T05:34:56.413258Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2403.02677","last_updated":"2024-03-05T06:05:15Z","snapshot_observed_at":"2026-08-03T18:49:39.598416Z","submitted_at":"2024-03-05T06:05:15Z","title":"Finetuned Multimodal Language Models Are High-Quality Image-Text Data Filters","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.02677","snapshot_observed_at":"2026-08-07T05:34:56.416946Z","title":"Finetuned multimodal language models are high-quality image- text data filters","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.416946Z"},"links":{"cited_paper":"/paper/2403.02677","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:c995b24fe9b4b4adb385aa21ad046efb3edfcc84ba3c69130efa32e14ef8e060","observation_id":"9c70c81f-6cc8-4285-b0ae-3ba391976aeb","resolution":{"observed_at":"2026-08-07T05:34:56.416946Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.559353Z","title":"The all-seeing project v2: Towards gen- eral relation comprehension of the open world, 2024","venue":null,"work_id":"aa4db799-4805-4f49-a7d7-dd3100ce31cc","year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.420682Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:86d3978cfcbcd2e0d49d71d2a3b7b0f0b234535735ddd0135f9dcac727d5cc37","observation_id":"e7760941-faf7-4006-b315-c3ce95d6a50b","resolution":{"observed_at":"2026-08-07T05:34:57.563117Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2204.07705","last_updated":"2022-10-24T07:00:15Z","snapshot_observed_at":"2026-07-06T13:00:53.618234Z","submitted_at":"2022-04-16T03:12:30Z","title":"Super-NaturalInstructions: Generalization via Declarative Instructions on 1600+ NLP Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2204.07705","snapshot_observed_at":"2026-08-07T05:34:56.424085Z","title":"Super- naturalinstructions: Generalization via declarative instructions on 1600+ nlp tasks","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.424085Z"},"links":{"cited_paper":"/paper/2204.07705","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:09dd179778125372b7422e5c8004b73e0a9598e32d4d192054951604f51ca34e","observation_id":"eb482150-f3de-4131-8e6a-9f0a12eecc9b","resolution":{"observed_at":"2026-08-07T05:34:56.424085Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2406.08394","last_updated":"2024-12-31T05:35:05Z","snapshot_observed_at":"2026-08-06T17:31:18.801416Z","submitted_at":"2024-06-12T16:44:50Z","title":"VisionLLM v2: An End-to-End Generalist Multimodal Large Language Model for Hundreds of Vision-Language Tasks","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2406.08394","snapshot_observed_at":"2026-08-07T05:34:56.427639Z","title":"Visionllm v2: An end- to-end generalist multimodal large language model for hundreds of vision-language tasks","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.427639Z"},"links":{"cited_paper":"/paper/2406.08394","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:6b95c82969f6ad72a35e2798c18813532b5f271a0b6b2dd57282bd879d01d2dc","observation_id":"eff2ee90-61f0-4ad2-88af-dc5d121c97ec","resolution":{"observed_at":"2026-08-07T05:34:56.427639Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.548073Z","title":"Scene graph generation by iterative message passing","venue":null,"work_id":"f25ee89b-7e64-4c85-b4b0-737bffdc3490","year":2017},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.431221Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:df36e77713d4c76e6997742d354c16e0bd881cfd7899730e21b44ec4a580e26b","observation_id":"87b5ebf0-12e0-4221-84d3-d315d3dda227","resolution":{"observed_at":"2026-08-07T05:34:57.551650Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:56.434261Z","title":"xgen-mm (blip-3): A family of open large multimodal models","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.434261Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:d67bdb125a19d171bd481dda3a63adb0b9d121826e649375b64ec8bf411ff9c5","observation_id":"e17624a3-2449-4eed-9fcd-06ae8670e146","resolution":{"observed_at":"2026-08-07T05:34:56.434261Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2407.10671","last_updated":"2024-09-10T13:25:53Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-07-15T12:35:42Z","title":"Qwen2 Technical Report","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2407.10671","snapshot_observed_at":"2026-08-07T05:34:56.437648Z","title":"Qwen2 technical report","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.437648Z"},"links":{"cited_paper":"/paper/2407.10671","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:35a8e3a55dc176bde6c8f0d5ef7a608920a316e9992b7ab912d2cf6f7032d49c","observation_id":"fb319264-96bb-4058-8a55-93a1f50e3353","resolution":{"observed_at":"2026-08-07T05:34:56.437648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.537781Z","title":"Panoptic scene graph generation","venue":null,"work_id":"8f960346-f142-4d84-b144-92e639982c2b","year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.441070Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:bee37fcd7240389679fad99f545aff04ca1f130f49d6a6d0b4d043a913a02be5","observation_id":"09a79a29-10c2-4eae-b2cc-344f781e72f3","resolution":{"observed_at":"2026-08-07T05:34:57.541562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2310.11441","last_updated":"2023-11-06T07:39:49Z","snapshot_observed_at":"2026-08-04T03:29:49.409446Z","submitted_at":"2023-10-17T17:51:31Z","title":"Set-of-Mark Prompting Unleashes Extraordinary Visual Grounding in GPT-4V","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.11441","snapshot_observed_at":"2026-08-07T05:34:56.444424Z","title":"Set-of-mark prompt- ing unleashes extraordinary visual grounding in gpt- 4v","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.444424Z"},"links":{"cited_paper":"/paper/2310.11441","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:e6a34bc0712867eb5f4fd8588cc47e497eaa4ea152d62d56cbcebeda48819dc4","observation_id":"490020ae-2146-45f2-9d49-c7f6978ec42a","resolution":{"observed_at":"2026-08-07T05:34:56.444424Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.527332Z","title":"Depth any- thing: Unleashing the power of large-scale unlabeled data","venue":null,"work_id":"405a49ce-d9c6-4498-94e4-ae312dcc5eed","year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.447428Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:cdffd67d23f5c3314146607a5bbc70056c72f3edb4c996cdd15cf7cb801c7d40","observation_id":"e564cc03-3c19-4c0a-bca7-aed2b9d4722e","resolution":{"observed_at":"2026-08-07T05:34:57.531233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2408.01800","last_updated":"2024-08-03T15:02:21Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-08-03T15:02:21Z","title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2408.01800","snapshot_observed_at":"2026-08-07T05:34:56.450803Z","title":"Minicpm-v: A gpt-4v level mllm on your phone","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.450803Z"},"links":{"cited_paper":"/paper/2408.01800","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:d6ec20079da38a87223710ba061f82ce96211636235105696c9e52980215c2f2","observation_id":"0b651cdb-e637-436e-93fe-b8a1eb327107","resolution":{"observed_at":"2026-08-07T05:34:56.450803Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2311.04257","last_updated":"2023-11-09T01:56:51Z","snapshot_observed_at":"2026-08-06T04:08:15.266897Z","submitted_at":"2023-11-07T14:21:29Z","title":"mPLUG-Owl2: Revolutionizing Multi-modal Large Language Model with Modality Collaboration","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2311.04257","snapshot_observed_at":"2026-08-07T05:34:56.454152Z","title":"mplug-owl2: Revolutionizing multi- modal large language model with modality collabora- tion","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.454152Z"},"links":{"cited_paper":"/paper/2311.04257","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:42fd337ffffaf5bee085953ae4e44f4a4cc56cf811594d60b6a79781f6c7c542","observation_id":"3ea739e7-06be-4d83-b0a8-81b1af7d4232","resolution":{"observed_at":"2026-08-07T05:34:56.454152Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2310.07704","last_updated":"2023-10-11T17:55:15Z","snapshot_observed_at":"2026-07-06T16:31:25.350087Z","submitted_at":"2023-10-11T17:55:15Z","title":"Ferret: Refer and Ground Anything Anywhere at Any Granularity","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2310.07704","snapshot_observed_at":"2026-08-07T05:34:56.457915Z","title":"Ferret: Refer and ground anything anywhere at any granularity","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.457915Z"},"links":{"cited_paper":"/paper/2310.07704","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b3e4415368488a64018bd6e34cd50b85643b052a3a1937d645054fd825ff4a78","observation_id":"48f06bb5-545d-471d-9d18-ede5f479399b","resolution":{"observed_at":"2026-08-07T05:34:56.457915Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.517430Z","title":"Modeling context in referring expressions","venue":null,"work_id":"21456227-0fc6-443b-9667-97917a462dfa","year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.461550Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:18c034609b5de675e3422348a44a0bdfd7cd9d4c57b4ae1b22d52d20d9c7c88c","observation_id":"fe124c37-9cd8-4e7d-93a7-4452f29765aa","resolution":{"observed_at":"2026-08-07T05:34:57.521049Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.507777Z","title":"Modeling context in re- ferring expressions","venue":null,"work_id":"51fe24ad-2f15-4c22-94e5-2846eb81c481","year":2016},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.464682Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:af63447cdde9f9a4d1262b29f4acae5d631a3234a8c357b840796c633c616f55","observation_id":"c17ffcaa-4999-47a3-b668-0dc29a7a7116","resolution":{"observed_at":"2026-08-07T05:34:57.511279Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.497356Z","title":"Rlip: Relational language-image pre-training for human-object interaction detection, 2022","venue":null,"work_id":"fb0ebb66-a857-4f6f-8c8a-6287ee9ec450","year":2022},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.468011Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:0d4fa181e055292b7a2d8b139e96d0493b73ecc5c5ec0fa2df9bf60e1a9ad99f","observation_id":"4f8809ee-4581-45f2-810f-dae7712da24b","resolution":{"observed_at":"2026-08-07T05:34:57.501079Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.486927Z","title":"Os- prey: Pixel understanding with visual instruction tun- ing, 2024","venue":null,"work_id":"5cae8cfe-6d92-4fb6-8645-9f38cf686ab6","year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.471582Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:290e8d2a26a39992b49c9959ffb9d470a44e7c397407bd5a39b153d12224e8b0","observation_id":"3af32829-0125-4437-b825-8da297d5b11f","resolution":{"observed_at":"2026-08-07T05:34:57.490871Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.476679Z","title":"Neural motifs: Scene graph pars- ing with global context","venue":null,"work_id":"4f5b0d11-c851-4309-ba7e-10d191883410","year":2018},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.474880Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:9f03ceea4e852fead8879db09dcf86f96e1ebd823c5b2766b6900f9c1bff67d8","observation_id":"8ad533fb-5a44-41fa-90ef-c9d01c30bbff","resolution":{"observed_at":"2026-08-07T05:34:57.480480Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:34:57.466501Z","title":"From recognition to cognition: Vi- sual commonsense reasoning","venue":null,"work_id":"439a024b-c941-486d-9a80-ff15352119cc","year":2019},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.478428Z"},"links":{"citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:be0dfd1fa7d6a44c122e52113bc552dfb1025472768eae6173def314582eef5c","observation_id":"20a541f8-b032-4737-8af2-a408fd3198b7","resolution":{"observed_at":"2026-08-07T05:34:57.470192Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-07T06:34:17.273281+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2312.02949","last_updated":"2023-12-05T18:29:31Z","snapshot_observed_at":"2026-08-08T01:04:28.020505Z","submitted_at":"2023-12-05T18:29:31Z","title":"LLaVA-Grounding: Grounded Visual Chat with Large Multimodal Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.02949","snapshot_observed_at":"2026-08-07T05:34:56.481852Z","title":"Llava-grounding: Grounded visual chat with large multimodal models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.481852Z"},"links":{"cited_paper":"/paper/2312.02949","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:c4a966908eb92fc942fbd46c731a6b74502495b0520de90f2aad9c255216599f","observation_id":"c210b42b-8c9b-405b-81ac-53a1ea037dab","resolution":{"observed_at":"2026-08-07T05:34:56.481852Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2409.20566","last_updated":"2024-09-30T17:59:34Z","snapshot_observed_at":"2026-08-05T16:49:53.377557Z","submitted_at":"2024-09-30T17:59:34Z","title":"MM1.5: Methods, Analysis & Insights from Multimodal LLM Fine-tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.20566","snapshot_observed_at":"2026-08-07T05:34:56.485538Z","title":null,"venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-08-07T05:34:56.485538Z"},"links":{"cited_paper":"/paper/2409.20566","citing_paper":"/paper/2506.07643"},"observation_digest":"sha256:b60f812a90f38ae8179dff97bde51320ebe0e57bbb4bdfa74fa049d6b44fbe16","observation_id":"2b467c74-ff80-4c1a-951d-140c60b59b96","resolution":{"observed_at":"2026-08-07T05:34:56.485538Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2506.07643","last_updated":"2025-06-09T11:09:10Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-07T05:26:32.056348Z","submitted_at":"2025-06-09T11:09:10Z","title":"Synthetic Visual Genome"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":89,"verified_exact":1,"verified_fuzzy":10},"total_outbound_references":136},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 8 August 2026, this Paper Citation Record lists 100 of 136 outbound references and 0 inbound Pith citation observations for arXiv:2506.07643."}