{"as_of":"2026-08-12T18:44:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:8a8c0d0f1712f09cd79a4588bd8e17685fc9da11d1110e1a929578fd41d65190","coverage":[{"denominator":30,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":30,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-14T16:12:58.882161Z","state":"measured"},{"denominator":30,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":30,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-12T06:34:41.77262+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.05716/citation-record","integrity":"/paper/2607.05716/integrity","json":"/paper/2607.05716/citation-record.json","paper":"/paper/2607.05716"},"outbound":[{"citation":{"cited_paper":{"arxiv_id":"2508.10925","last_updated":"2025-08-08T19:24:38Z","snapshot_observed_at":"2026-08-01T16:27:35.664983Z","submitted_at":"2025-08-08T19:24:38Z","title":"gpt-oss-120b & gpt-oss-20b Model Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.10925","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"K., Bai, Y ., Baker, B., Bao, H., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2508.10925","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:e2e5982b3c1a87347618dd0c6fad2407593fcb0da0710238d1408d19ec713bc8","observation_id":"3dc51d32-dfc8-41b1-a004-1994cc86de1d","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-08-11T14:42:37.584016Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Qwen3-vl technical report","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:0e4891a275f7728223401fa926d815f3e7cdd0b4737ec855a681055d24da85d6","observation_id":"6fcf583a-9dde-47f5-9976-532e3d5e6d1d","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Unifying vision-and- language tasks via text generation","venue":null,"work_id":null,"year":1931},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:75ff543e364e0b02bee42b27367239acbd3c22c6d7091d7c1ef2750af495e34a","observation_id":"93bb6b37-4803-4d71-afa4-fc20d61ac681","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.06261","last_updated":"2025-12-19T14:25:46Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-07-07T17:36:04Z","title":"Gemini 2.5: Pushing the Frontier with Advanced Reasoning, Multimodality, Long Context, and Next Generation Agentic Capabilities","version":6},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.06261","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Gemini 2.5: Pushing the frontier with advanced reasoning, multimodality, long context, and next generation agentic capabilities.arXiv preprint arXiv:2507.06261,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2507.06261","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:f51490eddda4a5a1a2ece400049f21027c6ead22b218a001f049b8041270fb5a","observation_id":"621cc074-5131-41f5-b815-d1d515d337f9","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.15879","last_updated":"2026-05-09T18:01:18Z","snapshot_observed_at":"2026-08-12T14:09:31.044610Z","submitted_at":"2025-05-21T17:54:49Z","title":"GRIT: Teaching MLLMs to Think with Images","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.15879","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"J., Guan, X., and Wang, X","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2505.15879","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:03f4c09fc1dc679b6177c7dda464a405468c6a889e4fc224b0e2afad09db607a","observation_id":"8c79a5ae-e61f-4544-b33e-d96d7766b491","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2501.12948","last_updated":"2026-01-04T03:57:36Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-01-22T15:19:35Z","title":"DeepSeek-R1: Incentivizing Reasoning Capability in LLMs via Reinforcement Learning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2501.12948","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"com/deepmind-media/Model-Cards/ Gemini-3-Pro-Model-Card.pdf","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2501.12948","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:aacea5a802bc34ba2e94397e6416815e877c91a46604e7b8a1f612bf0af5bd86","observation_id":"e29c0637-9707-4e2e-a854-96311e3071cc","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2511.05271","last_updated":"2026-03-11T08:46:41Z","snapshot_observed_at":"2026-07-06T22:35:13.699594Z","submitted_at":"2025-11-07T14:31:20Z","title":"DeepEyesV2: Toward Agentic Multimodal Model","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2511.05271","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Deepeyesv2: Toward agentic multimodal model.arXiv preprint arXiv:2511.05271,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2511.05271","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:10a49f475b491cf8d786c5cafddb93b345af1872e0cfbf5aeb20c306a509e048","observation_id":"ccd58374-5857-4d06-bdb7-164b50a54d64","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.06749","last_updated":"2026-02-28T21:10:52Z","snapshot_observed_at":"2026-08-07T18:44:26.813869Z","submitted_at":"2025-03-09T20:06:45Z","title":"Vision-R1: Incentivizing Reasoning Capability in Multimodal Large Language Models","version":4},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.06749","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Vision-r1: Incentivizing reasoning capability in multimodal large language models.arXiv preprint arXiv:2503.06749,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2503.06749","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:765b4d692a7ef851e4897890f93c83eaff1b935771fc57ab7d9085bc77f7fa39","observation_id":"e0a68e16-a5c9-4fa5-adf9-e85d34a0e569","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2410.21276","last_updated":"2024-10-25T17:43:01Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-10-25T17:43:01Z","title":"GPT-4o System Card","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2410.21276","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"P., Perelman, A., Ramesh, A., Clark, A., Ostrow, A., Welihinda, A., Hayes, A., Radford, A., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2410.21276","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:860dbdae885365602180baa501683beba1b6c94dbbd28374d6ceff6125b2296a","observation_id":"0c597887-75d0-4d21-ab67-7c58184babdb","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2412.16720","last_updated":"2026-04-30T02:46:40Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-12-21T18:04:31Z","title":"OpenAI o1 System Card","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2412.16720","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Openai o1 system card.arXiv preprint arXiv:2412.16720,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2412.16720","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:a9e636867eee00f002985b8428483749c775f502941f9bebaa386ca37325358a","observation_id":"144b49cf-a355-4511-8fe8-b615818d4be7","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Referitgame: Referring to objects in photographs of natu- ral scenes","venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:0864d0e71fd54ada71ab2df44a968b5f5f9ececa3aa37783ec5c1c36d2d468e0","observation_id":"73fea798-c620-4e7f-a31a-c404cc8c4a02","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"B., Liu, O., Guo, P., Neiswanger, W., Huang, F., et al","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:a113aa4992e4f85179309efa9705c25b209bd1b134b71cd5c27b7d4e989770a2","observation_id":"8bfce708-47b5-4aef-af18-f2198e5e2961","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2509.24251","last_updated":"2025-10-05T04:01:18Z","snapshot_observed_at":"2026-08-10T21:20:13.670725Z","submitted_at":"2025-09-29T03:52:01Z","title":"Latent Visual Reasoning","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2509.24251","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Latent visual reasoning.arXiv preprint arXiv:2509.24251, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2509.24251","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:dafb80fa0c3446b4fafa2d12076e4cec3cf7c5c95d6a56410cb7d1e23a8021e4","observation_id":"eaac7e21-34d8-4a19-9570-e6c8f58b5eb7","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:62d9ca792875a7116b5b721059fa20a488b232133b798c44fe3c8791e0783e3c","observation_id":"fe682f3a-5dde-4368-aa13-7a02f928b244","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2503.01785","last_updated":"2025-03-03T18:16:32Z","snapshot_observed_at":"2026-08-05T03:13:54.147007Z","submitted_at":"2025-03-03T18:16:32Z","title":"Visual-RFT: Visual Reinforcement Fine-Tuning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2503.01785","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Visual-rft: Visual reinforcement fine-tuning.arXiv preprint arXiv:2503.01785,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2503.01785","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:40e55a6b1e3545a33b5ac9e9798bee87c41cc1e56bf9d67619ff50dd5556f311","observation_id":"bfde5013-4da9-45c6-b6e3-ef7bc87b7c7b","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07089","last_updated":"2025-06-02T09:38:26Z","snapshot_observed_at":"2026-08-07T21:01:40.617151Z","submitted_at":"2025-04-09T17:58:58Z","title":"OmniCaptioner: One Captioner to Rule Them All","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07089","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Omnicaptioner: One cap- tioner to rule them all.arXiv preprint arXiv:2504.07089,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2504.07089","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:526ea8c586ef010de3b1b8c1a36371137e7a583dcc54cdc5a7188d5f53393242","observation_id":"28cde4be-7dcf-4d3d-893c-76029b9f4b60","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"L., Tan, J","venue":null,"work_id":null,"year":2022},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:101ece8c9de414e3cb1f006cafd88cc45ca7d1ab6e5a9737f11652f1fa20b2b3","observation_id":"8d95e82a-12cb-40a1-92e0-b63c09812553","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.07615","last_updated":"2025-04-14T15:15:54Z","snapshot_observed_at":"2026-08-08T20:11:45.308315Z","submitted_at":"2025-04-10T10:05:15Z","title":"VLM-R1: A Stable and Generalizable R1-style Large Vision-Language Model","version":2},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.07615","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Vlm-r1: A stable and generalizable r1-style large vision-language model","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2504.07615","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:ef0bbb7de15dfc05e0b92b577720dd38d06e12c6b62afa35d9e5d0d3550ddb98","observation_id":"8d6d2def-5f79-4e08-a815-29d8a719e7e2","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2506.23918","last_updated":"2025-07-03T16:49:39Z","snapshot_observed_at":"2026-08-11T12:22:14.746398Z","submitted_at":"2025-06-30T14:48:35Z","title":"Thinking with Images for Multimodal Reasoning: Foundations, Methods, and Future Frontiers","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2506.23918","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Thinking with images for multimodal reasoning: Foundations, methods, and future frontiers.arXiv preprint arXiv:2506.23918,","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2506.23918","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:28d0ba3bf04c294e6d7cdc9f80e792c56bd81afbc728e2bd55785eb648ba103b","observation_id":"77e876e6-f453-4939-93eb-07ec8a36a1e0","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.08837","last_updated":"2025-05-08T06:35:06Z","snapshot_observed_at":"2026-07-06T21:08:05.749656Z","submitted_at":"2025-04-10T17:41:56Z","title":"VL-Rethinker: Incentivizing Self-Reflection of Vision-Language Models with Reinforcement Learning","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.08837","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Vl-rethinker: Incentivizing self-reflection of vision- language models with reinforcement learning.arXiv preprint arXiv:2504.08837, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2504.08837","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:238b1d4e3c306cd9494b4f72e60c55dc23bf127b13df1bef50bdf8643449d7d6","observation_id":"abf6fdf4-2cc8-41de-9c11-c074a12d27eb","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2305.02677","last_updated":"2023-07-06T13:47:21Z","snapshot_observed_at":"2026-08-10T19:28:39.434196Z","submitted_at":"2023-05-04T09:48:22Z","title":"Caption Anything: Interactive Image Description with Diverse Multimodal Controls","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2305.02677","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Leveraging large language and vision models for knowledge extrac- tion from large-scale image–text colonoscopy records","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2305.02677","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:2f7774fc25e08647ba4dfe7b8d543ba1622aca136086b7974faf1f6d362bb519","observation_id":"410c8ca7-d0af-41d3-9183-ab82f413ac7b","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2505.09388","last_updated":"2025-05-14T13:41:34Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-14T13:41:34Z","title":"Qwen3 Technical Report","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2505.09388","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Qwen3 technical report.arXiv preprint arXiv:2505.09388, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2505.09388","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:0ffc2fd4e2d91b582b26e09ac65c1af271e089a8fd76c89a165b5678f9c340dc","observation_id":"6fd10c4c-b8fe-45d9-a9dd-090016831bec","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2507.03019","last_updated":"2025-07-02T14:59:35Z","snapshot_observed_at":"2026-08-12T06:11:43.310913Z","submitted_at":"2025-07-02T14:59:35Z","title":"Look-Back: Implicit Visual Re-focusing in MLLM Reasoning","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2507.03019","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Look-back: Implicit visual re-focusing in mllm reasoning","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2507.03019","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:e94b6304d8c462dd87902311126fcd1ce57cc092f752d233c9498be80a3984da","observation_id":"e2d3edb7-b771-4f98-82f2-678bc8a38447","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2502.17422","last_updated":"2025-02-24T18:54:40Z","snapshot_observed_at":"2026-08-07T17:52:20.236795Z","submitted_at":"2025-02-24T18:54:40Z","title":"MLLMs Know Where to Look: Training-free Perception of Small Visual Details with Multimodal LLMs","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2502.17422","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Mllms know where to look: Training-free perception of small visual details with multimodal llms.arXiv preprint arXiv:2502.17422, 2025a","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2502.17422","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:d1b074ef242e79d8a511af99dac754db5703dc2a659f70ce7b20932e37974342","observation_id":"dafdcad7-2020-4db2-8637-1f0acada9b85","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2508.11630","last_updated":"2025-08-15T17:59:49Z","snapshot_observed_at":"2026-08-03T04:02:35.392835Z","submitted_at":"2025-08-15T17:59:49Z","title":"Thyme: Think Beyond Images","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2508.11630","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Thyme: Think beyond images.arXiv preprint arXiv:2508.11630, 2025b","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2508.11630","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:ccf5fd61e85a22726f0b0db017134eaec2fa460fa00195ad2784dc47e83af64b","observation_id":"e371c26a-8b38-4a8b-a463-8ee95d19106b","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":{"arxiv_id":"2504.10479","last_updated":"2025-04-19T03:47:21Z","snapshot_observed_at":"2026-08-10T18:37:57.419939Z","submitted_at":"2025-04-14T17:59:25Z","title":"InternVL3: Exploring Advanced Training and Test-Time Recipes for Open-Source Multimodal Models","version":3},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2504.10479","snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Internvl3: Exploring advanced training and test-time recipes for open-source multimodal models.arXiv preprint arXiv:2504.10479, 2025a","venue":null,"work_id":null,"year":2023},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"cited_paper":"/paper/2504.10479","citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:f1d4e446b3b4cb6f30877f0900c664d8121bdb0f99f49ae816a8cb990941d7e6","observation_id":"7c359854-d584-4012-99cd-f014de4eb92e","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":null,"venue":null,"work_id":null,"year":2014},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:4bcaf3c0d2a86cc6fedae4b7be857b86ad70b5b70a24ab83cee092bdc9393e32","observation_id":"438da7f8-7e9f-4ca0-879f-6c20aa6c4425","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"More Results and Discussions B.1","venue":null,"work_id":null,"year":2025},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:7423bd6be47fe5205a2a8e13253c3149e72a9aeb28994b3a6978a8e8767d5140","observation_id":"28840800-a621-431a-92d3-6c803894852b","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"bike on left\\","venue":null,"work_id":null,"year":2020},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:982343da6258cdbf3614e95f8ebff475515c3f50e962565c36e69f581e167386","observation_id":"6727996e-04e7-4e98-945c-ab1ce426f8a6","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-14T16:12:58.882161Z","title":"Together, they effectively promote graph-aligned visual reasoning","venue":null,"work_id":null,"year":1949},"citing_paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models","version":3},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-14T16:12:58.882161Z"},"links":{"citing_paper":"/paper/2607.05716"},"observation_digest":"sha256:dd6736ecc1c73d705bcd2d23050924b88cc2f825a0df93f371b3c13dc2483cf6","observation_id":"c7436bae-73af-4a61-b7c1-c34cea9bf71c","resolution":{"observed_at":"2026-07-14T16:12:58.882161Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.05716","last_updated":"2026-07-13T06:34:36Z","latest_version":3,"primary_category":"cs.CV","snapshot_observed_at":"2026-08-05T15:34:13.656788Z","submitted_at":"2026-07-07T01:00:51Z","title":"Scene Graph Thinking: Reinforcing Structured Visual Reasoning for Multimodal Large Language Models"},"reference_resolution":{"displayed":30,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":0,"unresolved":29,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":30},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-12T06:34:41.77262+00:00","source":"crossref"},{"observed_at":"2026-08-12T06:34:36.333875+00:00","source":"retraction_watch"}],"thesis":"As of 12 August 2026, this Paper Citation Record lists 30 of 30 outbound references and 0 inbound Pith citation observations for arXiv:2607.05716."}