{"as_of":"2026-08-09T10:56:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:b67ff68ae2f3aa8adf131bbf561c60056d8252b8268f116b6eff4765b8676466","coverage":[{"denominator":48,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":48,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-07T05:22:12.194352Z","state":"measured"},{"denominator":51,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":51,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-09T06:31:02.800959+00:00","state":"measured"},{"denominator":3,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":3,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-03T10:44:08.297552Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"arxiv_reference","source_observed_at":"2026-05-14T20:42:58.205735Z","state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-08-03T10:44:08.297552Z","title":"Maruf, Ismini Lourentzou, Arka Daw, and Anuj Karpatne","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2601.11632","last_updated":"2026-05-27T09:42:06Z","snapshot_observed_at":"2026-08-07T16:45:57.772090Z","submitted_at":"2026-01-14T07:16:11Z","title":"KG-ViP: Bridging Knowledge Grounding and Visual Perception in Multi-modal LLMs for Visual Question Answering","version":3},"reference_index":11,"source":"arxiv_source","source_observed_at":"2026-08-03T10:44:08.297552Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2601.11632"},"observation_digest":"sha256:531a2e4e2c26be28eb47cf62c3a3b25efccde00633f4d1bd0c3a7e5130e3f199","observation_id":"6e2d48bd-84b8-45e0-be97-51eef825d1f8","resolution":{"observed_at":"2026-08-03T10:44:08.297552Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":"2506.08189","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-06-05T21:23:00.469572Z","title":"Maruf, Ismini Lourentzou, Arka Daw, and Anuj Karpatne","venue":null,"work_id":"cbddca0d-c267-4ae6-998c-96a9d03de270","year":2025},"citing_paper":{"arxiv_id":"2605.13667","last_updated":"2026-05-13T15:27:41Z","snapshot_observed_at":"2026-07-06T23:25:11.623026Z","submitted_at":"2026-05-13T15:27:41Z","title":"SceneGraphVLM: Dynamic Scene Graph Generation from Video with Vision-Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-05-14T20:39:56.448121Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2605.13667"},"observation_digest":"sha256:8252ea5406e8d61b96f5ff9ad190b7244138011a247399323c49a71e3bcda862","observation_id":"773895a4-abe5-4930-ac1f-05077e3c49f5","resolution":{"observed_at":"2026-05-14T20:42:58.209549Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.08189","snapshot_observed_at":"2026-08-01T07:04:59.338909Z","title":"arXiv preprint arXiv:2506.08189 (2025)","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.21580","last_updated":"2026-07-23T17:56:30Z","snapshot_observed_at":"2026-08-01T14:54:11.706877Z","submitted_at":"2026-07-23T17:56:30Z","title":"GraphVid: Interactive Graph-Controllable Video Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-01T07:04:59.338909Z"},"links":{"cited_paper":"/paper/2506.08189","citing_paper":"/paper/2607.21580"},"observation_digest":"sha256:f66ae4fc546bbf36a845cb4068beafc8c0063e0fc3248c818bf965de12aa6195","observation_id":"2f9aae3f-2b1b-492e-b041-e6c39371b4bf","resolution":{"observed_at":"2026-08-01T07:04:59.338909Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2506.08189/citation-record","integrity":"/paper/2506.08189/integrity","json":"/paper/2506.08189/citation-record.json","paper":"/paper/2506.08189"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2308.12966","last_updated":"2023-10-13T02:41:28Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2023-08-24T17:59:17Z","title":"Qwen-VL: A Versatile Vision-Language Model for Understanding, Localization, Text Reading, and Beyond","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2308.12966","snapshot_observed_at":"2026-08-07T05:22:12.087934Z","title":"Qwen-vl: A frontier large vision-language model with versatile abilities.arXiv preprint arXiv:2308.12966, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.087934Z"},"links":{"cited_paper":"/paper/2308.12966","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:d75d150fe1e4bfb6f5dff488817065d0aecd2946487d3448d7c3785cd03cf14d","observation_id":"c0fc7967-51b6-447b-b055-61b378c7e6ae","resolution":{"observed_at":"2026-08-07T05:22:12.087934Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2312.04314","last_updated":"2024-06-02T11:32:19Z","snapshot_observed_at":"2026-07-06T16:58:19.652601Z","submitted_at":"2023-12-07T14:11:00Z","title":"GPT4SGG: Synthesizing Scene Graphs from Holistic and Region-specific Narratives","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2312.04314","snapshot_observed_at":"2026-08-07T05:22:12.091525Z","title":"Gpt4sgg: Synthesizing scene graphs from holistic and region-specific narratives.arXiv preprint arXiv:2312.04314, 2023","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.091525Z"},"links":{"cited_paper":"/paper/2312.04314","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f25bab8b0958ff388b8af37b02a1f845fca45d61613bbb77ad07a2d29aaecf9b","observation_id":"f25714bf-0374-43a8-a38c-dad42bafb371","resolution":{"observed_at":"2026-08-07T05:22:12.091525Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.617397Z","title":"Expanding scene graph boundaries: fully open-vocabulary scene graph generation via visual-concept alignment and retention","venue":null,"work_id":"1048b2c4-8452-4618-aad0-f2b23bde2239","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.094288Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:78679dadef6635e12d024849e9b45476c2b02975d2761969342c6f19a4a812e2","observation_id":"58085406-ab58-40f7-89c5-380f19210270","resolution":{"observed_at":"2026-08-07T05:22:12.620025Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.609812Z","title":"Reltr: Relation transformer for scene graph generation.IEEE Trans- actions on Pattern Analysis and Machine Intelligence, 45(9): 11169–11183, 2023","venue":null,"work_id":"ddc560f8-817e-47b3-a086-a6c28aa7ee4a","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.096830Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:efcb3e6b75d1ad802239423267c76eac5ac20e6df566c87d38dce940a4644ea8","observation_id":"12ae2883-1520-484f-a502-e06b47a57183","resolution":{"observed_at":"2026-08-07T05:22:12.612736Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.17146","last_updated":"2024-12-05T14:28:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-09-25T17:59:51Z","title":"Molmo and PixMo: Open Weights and Open Data for State-of-the-Art Vision-Language Models","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.17146","snapshot_observed_at":"2026-08-07T05:22:12.099201Z","title":"Molmo and pixmo: Open weights and open data for state-of-the-art multi- modal models.arXiv preprint arXiv:2409.17146, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.099201Z"},"links":{"cited_paper":"/paper/2409.17146","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ad1861c50abff88a49120fc3c39542d68ff45b56610fc00f74365195425f9fa0","observation_id":"347bb022-99ea-4d76-b760-7e683b7f98cd","resolution":{"observed_at":"2026-08-07T05:22:12.099201Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.101904Z","title":"Prism-0: A predicate-rich scene graph genera- tion framework for zero-shot open-vocabulary tasks.arXiv preprint arXiv:2504.00844, 2025","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.101904Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:3464cc7f02b35d41152696181ee8699ee925d3506a9fbc261ec9b78493692c00","observation_id":"ab1b86b8-b2a4-407e-8684-09326248bc2c","resolution":{"observed_at":"2026-08-07T05:22:12.101904Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.08821","last_updated":"2022-05-18T12:29:49Z","snapshot_observed_at":"2026-07-06T11:01:05.577957Z","submitted_at":"2021-04-18T11:27:08Z","title":"SimCSE: Simple Contrastive Learning of Sentence Embeddings","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.08821","snapshot_observed_at":"2026-08-07T05:22:12.104420Z","title":"Simcse: Simple contrastive learning of sentence embeddings.arXiv preprint arXiv:2104.08821, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.104420Z"},"links":{"cited_paper":"/paper/2104.08821","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f32285a0480d3b3bd268ff141a226810fc8ad3eedfae83a3be65b9bb6762757c","observation_id":"7e752d72-4886-4e04-9aa2-c3206c38b5b6","resolution":{"observed_at":"2026-08-07T05:22:12.104420Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2104.13921","last_updated":"2022-05-12T01:27:40Z","snapshot_observed_at":"2026-08-08T10:08:57.896975Z","submitted_at":"2021-04-28T17:58:57Z","title":"Open-vocabulary Object Detection via Vision and Language Knowledge Distillation","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2104.13921","snapshot_observed_at":"2026-08-07T05:22:12.107012Z","title":"Open- vocabulary object detection via vision and language knowl- edge distillation.arXiv preprint arXiv:2104.13921, 2021","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.107012Z"},"links":{"cited_paper":"/paper/2104.13921","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:4326cb4eea8f81b31a4f031631478e8a75b6ff74dea041fd941c91f9b69f153d","observation_id":"e4064992-17d0-47ec-9142-2b387f3f5749","resolution":{"observed_at":"2026-08-07T05:22:12.107012Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.602604Z","title":"To- wards open-vocabulary scene graph generation with prompt- 7 based finetuning","venue":null,"work_id":"17ef5daa-f2ae-413d-97a9-560f7da1a2e7","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.109479Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:bd72e3dec0e6b078720661a0dcd83d16fbba5a59ee5255d0a4e2dbf3e7dc37b2","observation_id":"5d2effcd-34b2-470b-8d48-da7c88326306","resolution":{"observed_at":"2026-08-07T05:22:12.605387Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.01072","last_updated":"2020-07-02T13:02:54Z","snapshot_observed_at":"2026-08-05T08:16:27.809444Z","submitted_at":"2020-07-02T13:02:54Z","title":"Scene Graph Reasoning for Visual Question Answering","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2007.01072","snapshot_observed_at":"2026-08-07T05:22:12.111648Z","title":"Scene graph reasoning for visual question answering.arXiv preprint arXiv:2007.01072, 2020","venue":null,"work_id":null,"year":2007},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.111648Z"},"links":{"cited_paper":"/paper/2007.01072","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:7729488e9908d0487b13149e1b431a6a6b5442bbd5c527d3173aed862adfc1e8","observation_id":"ebe5fd25-ee12-4f92-81b4-9fd2e32e8673","resolution":{"observed_at":"2026-08-07T05:22:12.111648Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.114195Z","title":"Gqa: A new dataset for real-world visual reasoning and compositional question answering","venue":null,"work_id":null,"year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.114195Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:4955550dfb9e27be4ca82191d871a62e7df15fd6f7ccf14bf1515d2a188f5f10","observation_id":"39fd54ed-26af-4a45-a6aa-a5146ce61db2","resolution":{"observed_at":"2026-08-07T05:22:12.114195Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.591684Z","title":"Enhancing scene graph generation with hierarchical relationships and commonsense knowledge","venue":null,"work_id":"1c7507c1-b3e3-4ad7-83bf-812a9ebf8a1f","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.116526Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:72a555d53b36235165c7c80b47b31ba9a1600a204dd703b4b4c116c073e82164","observation_id":"b4b5ce4d-ae68-41f6-aab5-5e5c72e934fe","resolution":{"observed_at":"2026-08-07T05:22:12.594374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.583749Z","title":"Image retrieval using scene graphs","venue":null,"work_id":"06cf9e3b-d673-4350-8d2c-ef8722dc190f","year":2015},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.118645Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:35028d2ab3fb3fe7cf1d79e457ad292a6fccd0bea1465aafcffc9d0a475e9b14","observation_id":"552fd6b8-9ebf-4403-a986-1561a10867d6","resolution":{"observed_at":"2026-08-07T05:22:12.587225Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.12648","last_updated":"2024-05-21T09:56:48Z","snapshot_observed_at":"2026-07-06T18:17:12.404441Z","submitted_at":"2024-05-21T09:56:48Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","version":1},"cited_work":{"arxiv_id":"2405.12648","doi":null,"metadata_source":"pith","pith_arxiv_id":"2405.12648","snapshot_observed_at":"2026-08-07T05:22:12.245417Z","title":"Scene Graph Generation Strategy with Co-occurrence Knowledge and Learnable Term Frequency","venue":"cs.CV","work_id":"bf515c5f-7e06-4845-803a-3939e0ae0f67","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.120736Z"},"links":{"cited_paper":"/paper/2405.12648","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:79b7310b9bd165aa63c1f7c216879c39dd9ce3c99b217a462c296b249a17b737","observation_id":"696ec004-e2bf-40ce-9e50-a1f600cdf44b","resolution":{"observed_at":"2026-08-07T05:22:12.250576Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.576298Z","title":"Llm4sgg: large language models for weakly supervised scene graph generation","venue":null,"work_id":"ae557736-a9b8-4733-a928-e012890268c1","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.122900Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:2dbd94094f6750317b10dc5b03e07bb3c669de48eb8680148ef3ea22a91e0140","observation_id":"e21e7d9e-d8eb-4955-8b94-c9698e1a00c8","resolution":{"observed_at":"2026-08-07T05:22:12.579047Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.568762Z","title":"Visual genome: Connecting language and vision using crowdsourced dense image annotations.International journal of computer vision, 123:32–73, 2017","venue":null,"work_id":"456e38ad-fc5e-4e53-8983-fc1e7726f137","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.125074Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:036bedb7e1c98d1eca64a2f3a08d4a46563b2e930593a26ce702ed82d0f03883","observation_id":"c181adb0-57cc-41bd-bad9-4d7bad47c8ea","resolution":{"observed_at":"2026-08-07T05:22:12.571701Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.561008Z","title":null,"venue":null,"work_id":"b4e6a888-70ae-4108-afb7-9323b5dd6957","year":1956},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.126991Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:8fa1539e91f177f23bf84d1a045500d2e647891327f819ddcdfe1ce95996807d","observation_id":"96942250-333e-4d51-94be-96c8e55e2d9c","resolution":{"observed_at":"2026-08-07T05:22:12.563917Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.553702Z","title":"Gonzalez, Hao Zhang, and Ion Stoica","venue":null,"work_id":"9351a1d4-8b48-45e4-9762-a2d5f1277ccb","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.129134Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a6a3cf97f44d1a8309cae44630d3bc054a581024d999412b717d4c7e1848627e","observation_id":"234f1add-b521-4887-b86a-e8b758effe78","resolution":{"observed_at":"2026-08-07T05:22:12.556567Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.546599Z","title":"Blip: Bootstrapping language-image pre-training for unified vision- language understanding and generation","venue":null,"work_id":"07262743-b550-4e38-9b40-4ea9bc9ac223","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.131213Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:20d5bb5d756f4892b2773e805ec5936bb40b9af581d16131571c7329e0e09dc7","observation_id":"7060702d-f3f2-47d5-a9cf-5442e3405a86","resolution":{"observed_at":"2026-08-07T05:22:12.549301Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.133250Z","title":"Blip- 2: Bootstrapping language-image pre-training with frozen image encoders and large language models","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.133250Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:447c2bfb4e68f58abb82a6f6e0d353eb267560dde59c915fe17f2f26911447b9","observation_id":"cc27b857-6ec1-4e1f-82c9-3807eda49d7a","resolution":{"observed_at":"2026-08-07T05:22:12.133250Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.534323Z","title":"Sgtr: End-to- end scene graph generation with transformer","venue":null,"work_id":"1a21b56f-9f0b-46b7-8b99-5dfeeb46b4eb","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.135454Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:07aba233d14e81242b727282f3989af93bd79fc6bf1c5650440db591a9b5d53f","observation_id":"5b0f3a94-2ee0-4e36-8300-118e09f4fc59","resolution":{"observed_at":"2026-08-07T05:22:12.537311Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.527503Z","title":"From pixels to graphs: Open-vocabulary scene graph generation with vision-language models","venue":null,"work_id":"c94ce791-7102-4311-81a0-913c6e5f6ed8","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.137587Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:23698492a9ade79f91ef171c2139ab0dd49db429a66b85888d1daddfeb9f6504","observation_id":"a643e086-5fad-41cd-8288-23c100320f15","resolution":{"observed_at":"2026-08-07T05:22:12.530043Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.520624Z","title":"Gps-net: Graph property sensing network for scene graph generation","venue":null,"work_id":"b2b10b9a-bf6e-42f1-971b-fdfd3d3673ea","year":2020},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.139572Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:821cf2f5ec0509ccec685be4b3004207b92ba5cb3d0be682ed4c26ab7d9af838","observation_id":"2d53b965-e8b6-454c-b67f-ab098aab04df","resolution":{"observed_at":"2026-08-07T05:22:12.523285Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.141548Z","title":"Llava-next: Improved reason- ing, ocr, and world knowledge, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.141548Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:0e9b1ac97a80702b5c2a76c3be6b188b1614409cc692ff28c419ea5322c95d1c","observation_id":"e5deb73b-4c2c-4de7-bd78-7351c852f8e3","resolution":{"observed_at":"2026-08-07T05:22:12.141548Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.143903Z","title":"Visual instruction tuning.Advances in neural information processing systems, 36, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.143903Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:34142c48aa95cb54ecef415fdf34d7e6da74a104b68ea5d36d395a4e9147cc1d","observation_id":"ba7951ae-a5d1-4c26-98c6-f0aad3cb06fa","resolution":{"observed_at":"2026-08-07T05:22:12.143903Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.146147Z","title":"Grounding dino: Marrying dino with grounded pre-training for open-set object detection","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.146147Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a01acd2b1737af49cb2a80853594edb94556ad3771ca802c99e89dde6ce12ed1","observation_id":"d68dbdc3-7d4b-4cf5-95da-3c6769641e7d","resolution":{"observed_at":"2026-08-07T05:22:12.146147Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.502770Z","title":"Relation-aware hierarchical prompt for open-vocabulary scene graph generation","venue":null,"work_id":"c8be715f-b83d-4d17-91b8-d79926c94ca4","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.148127Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:b7117031173adfa2a542d04b4671ee4c7754e414494b1b8cb16d63e4c722a8a9","observation_id":"4f4b881e-e4f8-4a2b-9b7c-e647a1c58216","resolution":{"observed_at":"2026-08-07T05:22:12.505101Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.496281Z","title":"Visual relationship detection with language priors","venue":null,"work_id":"f059c24c-f612-4364-ba74-747ce52aab8d","year":2016},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.150609Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:efb190b5c440c54309c10c2734d56901c06f87102f3e2234e39019a0fbf96f0d","observation_id":"6637806e-20e0-4cd8-9a6c-e7ef2fca36c3","resolution":{"observed_at":"2026-08-07T05:22:12.498561Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.489839Z","title":"hello gpt-4","venue":null,"work_id":"5fbf05ab-1cd4-4dc8-b445-3bd748be9ed1","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.152786Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:4766de2cd7490efafe76156699db973f64d25fd506f0975463c297dac08b8051","observation_id":"988bbf7c-5eca-4d04-8db9-ae985e5cb788","resolution":{"observed_at":"2026-08-07T05:22:12.491902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.154832Z","title":"Learning transferable visual models from natural language supervi- sion","venue":null,"work_id":null,"year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.154832Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f9f8544bd61f9feed26bdbc4bc90ff97ee4d8ef641670373486923658f41cee4","observation_id":"0eb9fa80-0d12-430a-a583-b5d2f23f67e6","resolution":{"observed_at":"2026-08-07T05:22:12.154832Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"1908.10084","last_updated":"2019-08-27T08:50:17Z","snapshot_observed_at":"2026-07-06T08:17:05.681370Z","submitted_at":"2019-08-27T08:50:17Z","title":"Sentence-BERT: Sentence Embeddings using Siamese BERT-Networks","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1908.10084","snapshot_observed_at":"2026-08-07T05:22:12.156964Z","title":"Sentence-bert: Sentence embeddings using siamese bert-networks.arXiv preprint arXiv:1908.10084, 2019","venue":null,"work_id":null,"year":1908},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.156964Z"},"links":{"cited_paper":"/paper/1908.10084","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:fa2a81b1690f915bbd0a1309304b2905141a668916dcee6873af235d1bfa7b49","observation_id":"99885462-b79e-4011-8808-e3941a838617","resolution":{"observed_at":"2026-08-07T05:22:12.156964Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.478849Z","title":"Learning to compose dynamic tree structures for visual contexts","venue":null,"work_id":"bde7524f-908e-43b4-8644-f5d3107818b9","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.159122Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:8cd77af1e07e53aba265f75b76b57820d6bd62beda5cccab4a25961602f10877","observation_id":"812dc2d4-3b6a-4774-8498-ebbc3dfc3623","resolution":{"observed_at":"2026-08-07T05:22:12.481150Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.471388Z","title":"Unbiased scene graph generation from bi- ased training","venue":null,"work_id":"3008bb62-9105-457d-ad37-99e48a8e7552","year":2020},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.161392Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:77cb8d25b4be33a818c82b22f1f1460221f65e298292bab1032f20aeca65cc88","observation_id":"503d2f66-2ac8-4fb3-8522-b3c0e83d734c","resolution":{"observed_at":"2026-08-07T05:22:12.473950Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.05530","last_updated":"2024-12-16T17:39:39Z","snapshot_observed_at":"2026-07-06T17:41:42.995949Z","submitted_at":"2024-03-08T18:54:20Z","title":"Gemini 1.5: Unlocking multimodal understanding across millions of tokens of context","version":5},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2403.05530","snapshot_observed_at":"2026-08-07T05:22:12.163539Z","title":"Gemini 1.5: Unlocking mul- 8 timodal understanding across millions of tokens of context","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.163539Z"},"links":{"cited_paper":"/paper/2403.05530","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:617f71a319221e7cf371b02a57ed50a32230a4b59dfca4355f4b1708d17a7415","observation_id":"65b3abb5-eb71-4ee9-b3a4-86a26d7bf75b","resolution":{"observed_at":"2026-08-07T05:22:12.163539Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.464380Z","title":"Graph-structured representations for visual question answer- ing","venue":null,"work_id":"03301dcc-8ff0-4393-b314-5ba20fa5d5e9","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.166021Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:f0788c268ebfabdb145ce2518a91705400c4b46732104727902fc16b7b2ec66b","observation_id":"dd5f0b44-2676-4109-b62b-4b17ab9b1d5e","resolution":{"observed_at":"2026-08-07T05:22:12.466765Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.457629Z","title":"Structured sparse r-cnn for direct scene graph generation","venue":null,"work_id":"ade26a64-337c-4ea8-99c0-bdd7a5e7cb33","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.168519Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ce384653a4619b2f9c7871b71fd35aadbafd23cf7409d38198274dec0697a9f1","observation_id":"f63bdcee-c9a4-4717-8cd2-4cd0d6011ecc","resolution":{"observed_at":"2026-08-07T05:22:12.460126Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2409.12191","last_updated":"2024-10-03T15:54:49Z","snapshot_observed_at":"2026-08-06T05:35:29.109022Z","submitted_at":"2024-09-18T17:59:32Z","title":"Qwen2-VL: Enhancing Vision-Language Model's Perception of the World at Any Resolution","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2409.12191","snapshot_observed_at":"2026-08-07T05:22:12.170659Z","title":"Qwen2-vl: Enhancing vision-language model’s perception of the world at any resolution.arXiv preprint arXiv:2409.12191, 2024","venue":null,"work_id":null,"year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.170659Z"},"links":{"cited_paper":"/paper/2409.12191","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a9c685281210341c25ea6713b3062e227e4431d9922bb66e5c979b0ab4ef027e","observation_id":"95efe330-ac5c-42a4-88bf-5db75ab49aa4","resolution":{"observed_at":"2026-08-07T05:22:12.170659Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.450838Z","title":"Scene graph generation by iterative message passing","venue":null,"work_id":"06d3bd7d-b790-4a4a-82fc-53aca467cce3","year":2017},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.173090Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:88d81079912578d6f02dd8a87ee76dc68dec781a128d462017411f06058a2915","observation_id":"de25351e-2698-4140-9294-4e3b9e37c319","resolution":{"observed_at":"2026-08-07T05:22:12.453061Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.444558Z","title":"Llava-spacesgg: Visual instruct tuning for open-vocabulary scene graph generation with enhanced spatial relations","venue":null,"work_id":"851601ea-1991-4549-9846-2d4665c90b2c","year":2025},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.175109Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:faa526931b49eebb3a7ff7d79df62292aebbd9431db8676ce7bed9203d610687","observation_id":"61c721cb-7ad3-4e2d-a19c-af7d4c3059f5","resolution":{"observed_at":"2026-08-07T05:22:12.446937Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.437820Z","title":"Panoptic scene graph gen- eration","venue":null,"work_id":"46dfea8b-32dc-4d7b-b80e-387c29c904ba","year":2022},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.177220Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:4d328d4a201d3b9dddc9ed3d5cd9f0d99f7f06a0ba72276e7d0328cf6a8b5d91","observation_id":"4c8bca80-1123-4596-8c8e-04df8d28fe3a","resolution":{"observed_at":"2026-08-07T05:22:12.440066Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.431660Z","title":"Depth anything v2.Advances in Neural Information Processing Systems, 37: 21875–21911, 2024","venue":null,"work_id":"60a2ff0e-d8a7-46ed-bd55-f6130050e0af","year":2024},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.179475Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:ac224dec60819307c15709085a63c4249252db51c57f970f0dcd3cb48c77ff80","observation_id":"9d37b875-eaef-4109-87f9-bdf8b9876244","resolution":{"observed_at":"2026-08-07T05:22:12.433926Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.424014Z","title":"Cross-modal rela- tionship inference for grounding referring expressions","venue":null,"work_id":"c64e5409-587f-4eec-87e2-cc55062e502a","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.181569Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:583a3e115775d26969f3da7a1cf0f798bc4c57ffc6dc9b9f06021ebed84f81cc","observation_id":"8fa9a057-99ad-4258-87da-e326a9954e9a","resolution":{"observed_at":"2026-08-07T05:22:12.426876Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.416061Z","title":"Visually-prompted language model for fine- grained scene graph generation in an open world","venue":null,"work_id":"a7b2d63b-a891-430d-9072-76dfc2ef238a","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.183631Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:7e770352936c2b9e6a20e93667225ca89abfe8e0ef4c0d000d0e10e7ee27c493","observation_id":"ba671b8e-4c7b-42d5-91d1-bb93b9c4bb5c","resolution":{"observed_at":"2026-08-07T05:22:12.418720Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.408880Z","title":"Open-vocabulary object detection using captions","venue":null,"work_id":"7db48e9d-4ab9-400f-adca-c7b2f34b24fe","year":2021},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.185895Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:a17a763b1f2338ad5e291db9ccbefad4eb16ddfff7807d9453f017bb14bb8f4f","observation_id":"0d6453c6-b1c5-4294-8718-c055ff3cd14a","resolution":{"observed_at":"2026-08-07T05:22:12.411258Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1711.06640","last_updated":"2018-03-29T16:17:53Z","snapshot_observed_at":"2026-08-07T06:18:30.462319Z","submitted_at":"2017-11-17T17:33:01Z","title":"Neural Motifs: Scene Graph Parsing with Global Context","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"1711.06640","snapshot_observed_at":"2026-08-07T05:22:12.187935Z","title":"Neural motifs: Scene graph parsing with global context","venue":null,"work_id":null,"year":2018},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.187935Z"},"links":{"cited_paper":"/paper/1711.06640","citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:98a1e0a50eba641b69e0cb89903a167bd6f0eaf84e47a1fce35aab0cdb8717a9","observation_id":"db98507f-16df-4147-ae74-ecbab09f577c","resolution":{"observed_at":"2026-08-07T05:22:12.187935Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.400720Z","title":"Graphical contrastive losses for scene graph parsing","venue":null,"work_id":"515028a0-f55c-4336-be01-4a854946da38","year":2019},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.190254Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:b13f549b79d026cf3c1715a6325ef107c17f9793c212c76ebc47b9486972e360","observation_id":"e0d9e044-a009-4de3-a517-797cc1b16b3a","resolution":{"observed_at":"2026-08-07T05:22:12.403580Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.393873Z","title":"Learning to generate language- supervised and open-vocabulary scene graph using pre-trained visual-semantic space","venue":null,"work_id":"c0168880-e661-4020-9451-71d567c4ae60","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.192405Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:91c86f2f99e90481da4c840249686d23c05323c8d9274baf7f673145654242b4","observation_id":"eb752ca1-0f56-4403-8f17-e3ca98a7e91e","resolution":{"observed_at":"2026-08-07T05:22:12.396290Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-07T05:22:12.387028Z","title":"There is aXin the image","venue":null,"work_id":"552ec99a-1893-4203-8b8e-9b30ac87756d","year":2023},"citing_paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-08-07T05:22:12.194352Z"},"links":{"citing_paper":"/paper/2506.08189"},"observation_digest":"sha256:9db5ccacf135312855e956e0174c73a63067444bb175239b8ad44568d882ddcb","observation_id":"d22aa359-343e-48d7-ad0c-99ab81d9d6c2","resolution":{"observed_at":"2026-08-07T05:22:12.389239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-09T06:31:02.800959+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2506.08189","last_updated":"2025-06-09T19:59:05Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-08T14:25:29.491033Z","submitted_at":"2025-06-09T19:59:05Z","title":"Open World Scene Graph Generation using Vision Language Models"},"reference_resolution":{"displayed":48,"state_counts":{"malformed_identifier":0,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":18,"verified_exact":1,"verified_fuzzy":29},"total_outbound_references":48},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-09T06:31:02.800959+00:00","source":"crossref"},{"observed_at":"2026-08-09T06:30:57.326959+00:00","source":"retraction_watch"}],"thesis":"As of 9 August 2026, this Paper Citation Record lists 48 of 48 outbound references and 3 inbound Pith citation observations for arXiv:2506.08189."}