{"as_of":"2026-08-05T07:02:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:5b1781d108cd8323e5d76970609fa6df00c9253290e7401d730c8492eac44f2e","coverage":[{"denominator":231,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":100,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-08T01:54:30.649092Z","state":"measured"},{"denominator":101,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":101,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-05T06:32:48.257954+00:00","state":"measured"},{"denominator":1,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":1,"source":"paper_references, paper_reference_links","source_observed_at":"2026-08-01T08:39:37.738395Z","state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[{"citation":{"cited_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":"2607.06560","snapshot_observed_at":"2026-08-01T08:39:37.738395Z","title":"Vision as unified multimodal generation, 2026.https://arxiv.org/abs/2607.06560","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.21072","last_updated":"2026-07-23T09:04:48Z","snapshot_observed_at":"2026-08-01T08:39:34.039663Z","submitted_at":"2026-07-23T09:04:48Z","title":"Show, Don't Tell: Evaluating Spatial Cognition in Generative Pixels Rather Than LLM Text","version":1},"reference_index":2022,"source":"pdf_text","source_observed_at":"2026-08-01T08:39:37.738395Z"},"links":{"cited_paper":"/paper/2607.06560","citing_paper":"/paper/2607.21072"},"observation_digest":"sha256:8a6fa9e334d079e67b551ca9c0e808b63edb42a078ec2f039d1b78423c82b360","observation_id":"23f1e4ba-6321-4b1e-a023-24f3724d5ea7","resolution":{"observed_at":"2026-08-01T08:39:37.738395Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"links":{"evidence":"/evidence","html":"/paper/2607.06560/citation-record","integrity":"/paper/2607.06560/integrity","json":"/paper/2607.06560/citation-record.json","paper":"/paper/2607.06560"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.141008Z","title":"Dataone-synthetic-v1.0-sample, 2025","venue":null,"work_id":"0a2ff612-cf0f-4a24-92e1-282570da7a5b","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a8c456be1370005e536b7604e5e58d9c7208166b0f7c7f6853d4ff9125d693ee","observation_id":"14329a86-1436-4cd2-b60e-bc86ee11fd5f","resolution":{"observed_at":"2026-07-08T02:04:27.142232Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.118743Z","title":"Ttpla: An aerial-image dataset for detection and segmentation of transmission towers and power lines","venue":null,"work_id":"72b3d157-0727-4ce9-8663-6a78c77d6c8b","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:ddb3cd6b931d76cd6e63781cf3b28c301959e58731d79acff7a96503574833e5","observation_id":"0f379d01-c37c-406f-84a1-f41c0a1e8773","resolution":{"observed_at":"2026-07-08T02:04:27.120057Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.089816Z","title":"Matting human datasets","venue":null,"work_id":"32ba2da3-23cd-4929-95df-6abe04f7a987","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:52cc963f26299f3c659fae7221523d78965a66af59f4be6251c2219f1ad4c686","observation_id":"149c2d2c-e268-42df-9bbf-d7d30721f8c2","resolution":{"observed_at":"2026-07-08T02:04:27.091082Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.112512Z","title":"Flamingo: A visual language model for few-shot learning","venue":null,"work_id":"29b9ba9e-afc4-436f-b8a5-5443cdd154fd","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:47240ffad0f847ddbb7499d5ade3d8460061ae5f7007395e9f4f030a7afcf5f3","observation_id":"5c910035-4b5a-43ac-a8b7-a9e65fcf7bdd","resolution":{"observed_at":"2026-07-08T02:04:27.113959Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.300907","doi":"10.1109/lra.2020.3009075","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"IDDA: A large-scale multi-domain dataset for autonomous driving","venue":"IEEE Robotics and Automation Letters","work_id":"b1f07e6a-fdd6-4da2-b580-2ce7b49011cc","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:fff7cea664464dbee56241c0de5b39d6ce96a928a6d79999eca7ebb3852161e0","observation_id":"6b4dee0e-baea-4063-ac71-e8c5f0766b80","resolution":{"observed_at":"2026-07-08T02:04:26.041635Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:21.132939+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:21.132939+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.130523Z","title":"Open-world text-specified object counting,","venue":null,"work_id":"1b851f24-c239-4ca5-9cef-578bc574582f","year":null},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:ecfa47d4247d8f207aed2a8cf1e6bc0dc9f92f93996d1090363e0b18938796b5","observation_id":"1fb8eb27-9844-4836-88d9-7c4cc7c374f1","resolution":{"observed_at":"2026-07-08T02:04:27.132260Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.01851","last_updated":"2023-09-15T23:13:21Z","snapshot_observed_at":"2026-07-06T15:37:23.958419Z","submitted_at":"2023-06-02T18:14:21Z","title":"Open-world Text-specified Object Counting","version":2},"cited_work":{"arxiv_id":"2306.01851","doi":null,"metadata_source":"pith","pith_arxiv_id":"2306.01851","snapshot_observed_at":"2026-07-08T02:04:26.372379Z","title":"Open-world text-specified object counting","venue":"cs.CV","work_id":"79a9be6a-4ae1-43ec-be9a-83a9b57c3860","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2306.01851","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f3fd06635d27ccb523bf6a4095c42ef6fdb2efc100d2df473b23d2b439e933ad","observation_id":"fae6a27b-5208-4aaa-8fd6-16ceb9f082c9","resolution":{"observed_at":"2026-07-08T02:04:26.373912Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr.2014.471","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"2d human pose estimation: New benchmark and state of the art analysis","venue":null,"work_id":"e8cc20e2-f3dd-4cc5-a1a4-f382f9644161","year":2014},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":8,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:38938e537a743ea20cb96f6006ccbe5f7cc3a392399d9e42b69f5e2bb3767d0b","observation_id":"28634544-7d04-4fb9-9d07-98d9605dd16d","resolution":{"observed_at":"2026-07-08T02:04:26.040736Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:21.59115+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:21.59115+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2403.13064","last_updated":"2024-03-19T18:01:29Z","snapshot_observed_at":"2026-08-03T20:59:14.753441Z","submitted_at":"2024-03-19T18:01:29Z","title":"SceneScript: Reconstructing Scenes With An Autoregressive Structured Language Model","version":1},"cited_work":{"arxiv_id":"2403.13064","doi":null,"metadata_source":"pith","pith_arxiv_id":"2403.13064","snapshot_observed_at":"2026-07-08T02:04:26.374263Z","title":"Scenescript: Reconstructing scenes with an autoregressive structured language model","venue":"cs.CV","work_id":"e33db30c-4465-4cfd-b71d-1a407bb43dd5","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2403.13064","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:06a36cff2501c17ffcec3bf23c1b71737099417d6ce9ee1fc38abbb3b915c826","observation_id":"fec34e38-0e46-405d-a881-ff6c68e85ed5","resolution":{"observed_at":"2026-07-08T02:04:26.375455Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.098086Z","title":null,"venue":null,"work_id":"ef4a5afd-455e-4a28-81a8-b39a4238efe0","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f1728e4dba2e8345a1e97aa7c5a9b995c7f43f5c5e455bc3a1b5245009db79b0","observation_id":"63184c61-cfac-4a3c-93b2-8836e5c74007","resolution":{"observed_at":"2026-07-08T02:04:27.099221Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2511.21631","last_updated":"2025-11-27T12:16:54Z","snapshot_observed_at":"2026-07-06T22:37:03.716474Z","submitted_at":"2025-11-26T17:59:08Z","title":"Qwen3-VL Technical Report","version":2},"cited_work":{"arxiv_id":"2511.21631","doi":"10.1016/j.neunet.2025.107777","metadata_source":"pith","pith_arxiv_id":"2511.21631","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Qwen3-VL Technical Report","venue":"cs.CV","work_id":"1fe243aa-e3c0-4da6-b391-4cbcfc88d5c0","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2511.21631","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f732e8def810fc1794866dc454194876131fb79d8b2ae13391e4e00d6f044210","observation_id":"be3d0ff4-98df-47ad-82fc-fe3cf664aab1","resolution":{"observed_at":"2026-07-08T02:04:26.433787Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.701499Z","title":"Zerowaste dataset: Towards deformable object segmentation in cluttered scenes","venue":null,"work_id":"763dde95-55c3-4d41-bf60-66ffad4e743a","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:50db36f9d553947c267e1f8ac03b3ab0d7f26e8d761715a596a30405da51f164","observation_id":"c43e6536-ceac-4a6a-b059-ee513b2c506c","resolution":{"observed_at":"2026-07-08T02:14:26.702708Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.701681Z","title":null,"venue":null,"work_id":"a6f08b54-da62-4ccc-aac8-5545ff75adcd","year":1901},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:bfc1cf65a32453e34e09b8cdf559572f6d3a2c00ed15067598cb4327d689e56c","observation_id":"390795ff-a94f-4104-8af0-5f39ffec0b03","resolution":{"observed_at":"2026-07-08T02:14:26.702881Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.688840Z","title":"CDLA: A chinese document layout analysis dataset","venue":null,"work_id":"1badb9ef-7072-4fe8-b75a-c04c60936871","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:ff30029ed2599396ae0e645ab3745fff293867eb7bd5718aa953712d8cdf91da","observation_id":"578c729c-c99f-4981-ad3b-a2a0a9d5b220","resolution":{"observed_at":"2026-07-08T02:14:26.689995Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.696193Z","title":"The 2019 davis challenge on vos: Unsupervised multi-object segmentation","venue":null,"work_id":"8f607860-bb89-4a4e-a488-1cc08b9aaad4","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:3e9dd862d513072a613af6af1ac2977b53de1b6d9b3fe178bbb451875dc3e344","observation_id":"872e9d5b-71a4-418d-b45d-4c1999c2eb8b","resolution":{"observed_at":"2026-07-08T02:14:26.697432Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.699769Z","title":"Rethinking object detection in retail stores","venue":null,"work_id":"3f8e6351-e0c2-414e-9427-e0161db16522","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:6c5669a30c9fbd7948283fe9093de553cf31ddc4657b4ed59d802c9ee2d2f92d","observation_id":"f5531b8d-d21b-43cc-a91d-ecbcd87ae490","resolution":{"observed_at":"2026-07-08T02:14:26.700974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.692413Z","title":"Scaling spatial intelligence with multimodal foundation models","venue":null,"work_id":"f9752bc3-0dda-4026-8a45-e0693c770185","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:5e833e7f1bd080fbd1d1b16aff44fc62b20b5bbd7363434273952315b428dfa3","observation_id":"33583841-cdc0-4c88-8d40-79e876d06be2","resolution":{"observed_at":"2026-07-08T02:14:26.693711Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2405.09818","last_updated":"2025-03-21T05:54:00Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2024-05-16T05:23:41Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","version":2},"cited_work":{"arxiv_id":"2405.09818","doi":"10.48550/arxiv.2405.09818","metadata_source":"pith","pith_arxiv_id":"2405.09818","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Chameleon: Mixed-Modal Early-Fusion Foundation Models","venue":"cs.CL","work_id":"2661b9a6-25cc-41a1-8100-612d2b801289","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2405.09818","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a11b3218cb2900e6cbd864ca4e42b5e40ff0e342b56a9f171eb5008e14ca25ec","observation_id":"f9b3e33c-b0d9-4ed0-a6f7-78f1ff5a49c0","resolution":{"observed_at":"2026-07-08T02:04:25.987284Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.013335+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.690964Z","title":"Industrial-site-safety-detection-v1-dataset","venue":null,"work_id":"340f37a4-eb23-4fe9-830c-4d4155074cfe","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:0a8d8f405890f3311e1a1af3d632766e2b7b9514b4ba9a13cf2f2b35d97da3a7","observation_id":"2e0019e9-6e56-4974-8fdb-0d3aa5c3cda9","resolution":{"observed_at":"2026-07-08T02:14:26.692172Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2306.15195","last_updated":"2023-07-03T16:08:00Z","snapshot_observed_at":"2026-07-06T15:47:07.545213Z","submitted_at":"2023-06-27T04:31:52Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","version":2},"cited_work":{"arxiv_id":"2306.15195","doi":"10.48550/arxiv.2306.15195","metadata_source":"pith","pith_arxiv_id":"2306.15195","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Shikra: Unleashing Multimodal LLM's Referential Dialogue Magic","venue":"cs.CV","work_id":"44525076-312a-4259-b79c-134cd7eeb297","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2306.15195","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:fdd9d2a483242fb76a739fcf22cc9f206a0371d5e418097f7a53210c653654a0","observation_id":"fe29178b-76b0-4ea7-95d9-189c0c4fe96d","resolution":{"observed_at":"2026-07-08T02:04:26.428515Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.685392Z","title":"Fleet, and Geoffrey Hinton","venue":null,"work_id":"35956ff9-af25-4b22-91ae-df5a45d2d0ab","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:48f99b01114795ef66968d936a90efe6aefdb6e27b1d363a0a0c648720399655","observation_id":"b93e2bd0-317e-4f1e-a7be-712c75f321f8","resolution":{"observed_at":"2026-07-08T02:14:26.686607Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.700029Z","title":null,"venue":null,"work_id":"4b26f308-762f-4847-b330-3ef6ac7615f5","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:667b77dcaf82332a66d1000874bbacac6f8d6e0e23115328717bd06b4b91e5d3","observation_id":"49bbeccd-a0fc-4500-b1cb-9273644bb7a3","resolution":{"observed_at":"2026-07-08T02:14:26.701135Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.698060Z","title":"Large-scale structure from motion with semantic constraints of aerial images","venue":null,"work_id":"c030433e-7f6a-4d79-ac1e-e4776a4c68ae","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:252417363092b0918e8f17ad4e30723e7ce9227afecf7219f840c966c96c40cd","observation_id":"dbdab1f4-633c-461f-a69a-01dc2ad692d0","resolution":{"observed_at":"2026-07-08T02:14:26.699233Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.705106Z","title":"Intern vl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"96e682d3-4746-47e6-9c76-85ffcfb1ace9","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":25,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:9242aea594be821693a50ff7986c49f59678c62e32c1d00b67701c9ddf31dc61","observation_id":"18cbea02-7b04-4548-8d03-99a2b8ee1966","resolution":{"observed_at":"2026-07-08T02:14:26.706562Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.707184Z","title":"Internvl: Scaling up vision foundation models and aligning for generic visual-linguistic tasks","venue":null,"work_id":"9ead6e75-42df-4630-bfc1-0cc11eb55ef0","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":26,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:fe36545a1ac75534e0a5f9e927da32d4e155d076d5ff88f55b04dbd69bcd600b","observation_id":"e7548657-eb4f-494b-87ea-105884b49fba","resolution":{"observed_at":"2026-07-08T02:14:26.708408Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.685073Z","title":"Schwing, Alexander Kirillov, and Rohit Girdhar","venue":null,"work_id":"9140c3e3-120e-46dc-aeb7-9f3fdbb3997b","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":27,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a8d79537530ef484af9414d2bce70d6f566dcb8860c2269032210a3b5740eddd","observation_id":"e7ec7402-0896-463f-b38b-6a71f328799e","resolution":{"observed_at":"2026-07-08T02:14:26.686271Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.5220/0010303401850195","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Domain adaptation for traffic density estimation","venue":null,"work_id":"2418002f-5485-4bf6-8887-36df56e7e845","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":28,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b058cecabd0e64cb104fdf296c622a4e5fbc6ccc7435254e5ef25b389237d9fd","observation_id":"f7601215-6e08-4693-a61e-f4effe6e0e0b","resolution":{"observed_at":"2026-07-08T02:04:26.007256Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.438345+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.438345+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.703232Z","title":"The cityscapes dataset","venue":null,"work_id":"86277525-b4ed-46af-8c6a-fe4f28cbd368","year":2015},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":29,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:766f0f1af51b99d2dd65b9635affd1d863ea70dabb1a690fcf4263e4f400a658","observation_id":"45098d0c-0eac-4f31-892c-97322c6af01d","resolution":{"observed_at":"2026-07-08T02:14:26.704342Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.692730Z","title":"The cityscapes dataset for semantic urban scene understanding","venue":null,"work_id":"f41683b7-7f15-49c2-ab76-6c949f21dfad","year":2016},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":30,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:7b871359ba6e9050066eac8bb8a0b24a646e10b043577892389e64e05690cd60","observation_id":"c18d2d5b-d843-4915-891f-0d2f98754520","resolution":{"observed_at":"2026-07-08T02:14:26.694108Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1702.04405","last_updated":"2017-04-11T08:09:33Z","snapshot_observed_at":"2026-07-06T05:30:03.873605Z","submitted_at":"2017-02-14T22:08:03Z","title":"ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes","version":2},"cited_work":{"arxiv_id":"1702.04405","doi":null,"metadata_source":"pith","pith_arxiv_id":"1702.04405","snapshot_observed_at":"2026-07-08T02:04:26.434852Z","title":"ScanNet: Richly-annotated 3D Reconstructions of Indoor Scenes","venue":"cs.CV","work_id":"83d45b60-7f10-4050-83db-3dbd1b9428de","year":2017},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":31,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/1702.04405","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1ce85c934be440b30032bb1506a0542f6547ae1899d8831e35c16d01ba257b54","observation_id":"07ec1fb6-7fd6-4f81-8812-a23afa29a50e","resolution":{"observed_at":"2026-07-08T02:04:26.436129Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2212.08051","last_updated":"2022-12-15T18:56:53Z","snapshot_observed_at":"2026-07-06T14:31:07.280398Z","submitted_at":"2022-12-15T18:56:53Z","title":"Objaverse: A Universe of Annotated 3D Objects","version":1},"cited_work":{"arxiv_id":"2212.08051","doi":"10.48550/arxiv.2212.08051","metadata_source":"pith","pith_arxiv_id":"2212.08051","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Objaverse: A universe of annotated 3d objects","venue":"cs.CV","work_id":"52bce3bf-3312-4fb3-adfb-99364be316ed","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":32,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2212.08051","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f61402f8d0938b29629765618c126131b0f8373423a763ebc0853aae2403e713","observation_id":"5c73ca71-cb9e-474a-8c8a-73e9975931d8","resolution":{"observed_at":"2026-07-08T02:04:26.303666Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.080913Z","title":"Smith, Hanna Hajishirzi, Ross Girshick, Ali Farhadi, and Aniruddha Kembhavi","venue":null,"work_id":"1a547b71-5452-4172-89dd-c9736014ac05","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":33,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:cd8e09ea6ad6b23be6739b5c6914b94de4635b549ef66708a600a4c5103f7d3f","observation_id":"eb15dd6d-103b-46fb-8167-286a773cda28","resolution":{"observed_at":"2026-07-08T02:04:27.082212Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2505.14683","last_updated":"2025-07-27T11:45:16Z","snapshot_observed_at":"2026-07-06T02:11:23.670680Z","submitted_at":"2025-05-20T17:59:30Z","title":"Emerging Properties in Unified Multimodal Pretraining","version":3},"cited_work":{"arxiv_id":"2505.14683","doi":"10.48550/arxiv.2505.14683","metadata_source":"pith","pith_arxiv_id":"2505.14683","snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Emerging Properties in Unified Multimodal Pretraining","venue":"cs.CV","work_id":"e0cfd82c-f5d4-44fd-b531-ec73ab0a805b","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":34,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2505.14683","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f7b9071ea0ec39ef151d976ebac8025afa066face1b43ebd8f371fd6a8eaad14","observation_id":"206f9ac7-7a21-48b2-8137-3e761ceba446","resolution":{"observed_at":"2026-07-08T02:04:26.301186Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.042644Z","title":"Coconut: Modernizing coco segmentation","venue":null,"work_id":"051a3924-6d99-4a07-9af5-2eb50d4c4f6a","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":35,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:43a5e067ecbce23183ea4636b2d7141bd6d2103ede23dd772e9888807c94a4f7","observation_id":"2af2eccf-9a14-4dec-bb15-fec01c0c8e58","resolution":{"observed_at":"2026-07-08T02:04:27.044055Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2605.12500","last_updated":"2026-05-12T17:59:58Z","snapshot_observed_at":"2026-07-06T23:24:13.851504Z","submitted_at":"2026-05-12T17:59:58Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","version":1},"cited_work":{"arxiv_id":"2605.12500","doi":null,"metadata_source":"pith","pith_arxiv_id":"2605.12500","snapshot_observed_at":"2026-07-08T02:04:26.362870Z","title":"SenseNova-U1: Unifying Multimodal Understanding and Generation with NEO-unify Architecture","venue":"cs.CV","work_id":"3fc01381-3983-477d-a5cf-193da464f6e3","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":36,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2605.12500","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f9ee2dfaf6197477f98f9d2c0f535aac32f4ea9eb3b27088c81651fc71e6f709","observation_id":"fc9d60c5-a1f8-4468-a9f1-a5ba17bf8b9e","resolution":{"observed_at":"2026-07-08T02:04:26.364613Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2021.31179","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.384011Z","title":"Object detection in aerial images: A large-scale benchmark and challenges","venue":null,"work_id":"07a5efff-2f1d-4522-bbdd-6ffdaadcd87d","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":37,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:2836defcbcaa59eed94c5978d5318dcb54b602cb20062ba321feed9e804d09ce","observation_id":"8645e850-cdc1-401c-9730-56547636fde9","resolution":{"observed_at":"2026-07-08T02:04:26.385721Z","resolver_source":"arxiv_id","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.136904Z","title":"Visdrone-det2019: The vision meets drone object detection in image challenge results","venue":null,"work_id":"5665582e-6671-450c-a9bd-e0e370969a80","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":38,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:54cd39ec1049674c9afca9bfe12041b8d5c82d158f5f92890997cd224a416bb5","observation_id":"a5453fca-0f35-48a7-8af3-59c426c60ed2","resolution":{"observed_at":"2026-07-08T02:04:27.138374Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.622866Z","title":"MoRe: Motion-aware feed-forward 4d reconstruction transformer","venue":null,"work_id":"ff5d03be-55e2-4fef-871c-a7e3eb46e68e","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":39,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1db8e1cdf532bd7b40048cbc7e244b9ee7b999ceec8dd73e89dc41450ecb1d54","observation_id":"8759c6f8-ae54-46de-93d4-1fe9137305b3","resolution":{"observed_at":"2026-07-08T02:14:26.624196Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-01249-6","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Mvtec d2s: Densely segmented supermarket dataset","venue":"Lecture notes in computer science","work_id":"91023076-03a6-4466-978c-aebd1d801644","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":40,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:97d3c91c4b590131704dbb54f031ea7033666c747ace35d6749b59bb805fbac0","observation_id":"f17162fc-0190-4ba3-8c69-501b72c73dc0","resolution":{"observed_at":"2026-07-08T02:04:26.031869Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:22.808026+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:22.808026+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2109.03805","last_updated":"2021-12-23T19:16:51Z","snapshot_observed_at":"2026-08-01T00:42:55.043956Z","submitted_at":"2021-09-08T17:45:37Z","title":"Panoptic nuScenes: A Large-Scale Benchmark for LiDAR Panoptic Segmentation and Tracking","version":3},"cited_work":{"arxiv_id":"2109.03805","doi":null,"metadata_source":"pith","pith_arxiv_id":"2109.03805","snapshot_observed_at":"2026-07-08T02:04:26.351433Z","title":"Panoptic nuscenes: A large-scale benchmark for lidar panoptic segmentation and tracking.arXiv preprint arXiv:2109.03805","venue":"cs.CV","work_id":"8a0344b2-1ddb-42d7-ba26-2310dc455ea9","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":41,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2109.03805","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:98131911e6aa447f64fe8b677571d7e96096a17fb5ed71c1cd7c3f5cab1dbed9","observation_id":"9a92b372-58d7-412a-8ca1-9dd2099a1132","resolution":{"observed_at":"2026-07-08T02:04:26.353443Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2512.02448","doi":null,"metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.338537Z","title":"nuscenes revisited: Progress and challenges in autonomous driving","venue":null,"work_id":"21f2f17a-7147-4fd0-abb3-f22ce25ecef1","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":42,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:845658d55735705010d6ea448f76a27ccbb7cd78f819b2f601ffaf3ee3355d52","observation_id":"77621a5c-c86c-4207-b700-6f4febb8225b","resolution":{"observed_at":"2026-07-08T02:04:26.340292Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2604.20329","last_updated":"2026-06-03T18:02:24Z","snapshot_observed_at":"2026-07-06T23:06:49.210284Z","submitted_at":"2026-04-22T08:23:48Z","title":"Image Generators are Generalist Vision Learners","version":3},"cited_work":{"arxiv_id":"2604.20329","doi":null,"metadata_source":"pith","pith_arxiv_id":"2604.20329","snapshot_observed_at":"2026-07-11T00:07:42.154080Z","title":"Image Generators are Generalist Vision Learners","venue":"cs.CV","work_id":"71cd4d6e-573d-4c90-8835-f18259bdbaf7","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":43,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2604.20329","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:49e279caa3bd132df817685ee043d53de86b515861151fe826543b8933cc7345","observation_id":"91402eb4-a29e-4bab-a710-22842666e0c6","resolution":{"observed_at":"2026-07-08T02:04:26.419598Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.707002Z","title":"Virtual worlds as proxy for multi-object tracking analysis,","venue":null,"work_id":"d625c936-2397-4da5-a33c-d75dc3c8e443","year":null},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":44,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:6ebd4eb1196a6fd39742d3c9e9b0a173589b4e1b02687a9389e276b3b98fc1f9","observation_id":"e96c58c5-935f-4380-8b57-cc192b68fee3","resolution":{"observed_at":"2026-07-08T02:14:26.708685Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1605.06457","last_updated":"2016-05-20T18:03:07Z","snapshot_observed_at":"2026-07-06T04:57:02.729338Z","submitted_at":"2016-05-20T18:03:07Z","title":"Virtual Worlds as Proxy for Multi-Object Tracking Analysis","version":1},"cited_work":{"arxiv_id":"1605.06457","doi":null,"metadata_source":"pith","pith_arxiv_id":"1605.06457","snapshot_observed_at":"2026-07-08T02:04:26.423977Z","title":"Virtual Worlds as Proxy for Multi-Object Tracking Analysis","venue":"cs.CV","work_id":"e2da6bed-6ef8-458a-91f0-82724775929b","year":2016},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":45,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/1605.06457","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:3a4bb72894b0e9df0830360170fe6cc0b909912f304c4fcc72641dbaf28e8e44","observation_id":"e92083f0-082c-4159-809e-b61c4e7bbe7c","resolution":{"observed_at":"2026-07-08T02:04:26.425342Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1609/aaai.v40i25.39268","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Visual bridge: Universal visual perception representations generating","venue":"Proceedings of the AAAI Conference on Artificial Intelligence","work_id":"1615a912-3d8c-4192-9c4a-61b194f679ae","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":46,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a6c8beb7d08ab0d6068ef0bacaacb4f47cc49627baca92bd8f2a14960d3f639d","observation_id":"97f9b6d1-81cb-45f5-ad05-90c4e27d1504","resolution":{"observed_at":"2026-07-08T02:04:26.075870Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:23.257205+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:23.257205+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2508.02047","last_updated":"2025-08-04T04:29:06Z","snapshot_observed_at":"2026-07-06T22:07:16.776694Z","submitted_at":"2025-08-04T04:29:06Z","title":"Mapillary Vistas Validation for Fine-Grained Traffic Signs: A Benchmark Revealing Vision-Language Model Limitations","version":1},"cited_work":{"arxiv_id":"2508.02047","doi":null,"metadata_source":"pith","pith_arxiv_id":"2508.02047","snapshot_observed_at":"2026-07-08T02:04:26.304866Z","title":"Mapillary Vistas Validation for Fine-Grained Traffic Signs: A Benchmark Revealing Vision-Language Model Limitations","venue":"cs.CV","work_id":"5a92c7cb-8bdb-493b-9a97-fcf13530937f","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":47,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2508.02047","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:45dc803f3e420cf2d0efa2ae28af3cdc626405ae0ced70032001077765ce49b2","observation_id":"cefa197d-09ec-401d-91a3-d31a3f813bb7","resolution":{"observed_at":"2026-07-08T02:04:26.306295Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.056168Z","title":"A versatile benchmark for detection, pose estimation, segmentation and re-identification of clothing images","venue":null,"work_id":"a4f940d0-18f4-445a-942a-13ef7a65d866","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":48,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:139954e48a3801481d7880f3ebef15743708bdf9c37453e7d2a0a44d189ebe87","observation_id":"e095b4e9-36b8-49ba-866c-e1bf4ed5077b","resolution":{"observed_at":"2026-07-08T02:04:27.057515Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.088015Z","title":"Vision meets robotics: The KITTI dataset","venue":null,"work_id":"fd205dd5-28c5-4cba-a0a3-22deb3825cb1","year":2013},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":49,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:9f77f690fba6e49032844cc9b0e371719eed81830ff216c0a5423eed6b59ce39","observation_id":"88c0661d-2770-4749-8c92-b550a01dfa7d","resolution":{"observed_at":"2026-07-08T02:04:27.089280Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.065914Z","title":"GenEval: An object-focused framework for evaluating text-to- image alignment","venue":null,"work_id":"e32e9ac8-f466-42e4-90cd-5385e199beeb","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":50,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:db4202b9a0db8f0b507a115932dc6fa80b1c0e06326bbb17901d7b5b6ae28dfe","observation_id":"5a97b4c7-56b1-41d9-8765-2dc420a50575","resolution":{"observed_at":"2026-07-08T02:04:27.067418Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.084590Z","title":"Precise detection in densely packed scenes","venue":null,"work_id":"6f4b736f-7869-4c83-a704-0749d837c87d","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":51,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:2b77e9cf0720750ad66cfb125aa02b0d0bf0c0f6202f734062c7618d7866a559","observation_id":"f08b6a3a-6663-450e-a6fb-a3bfbd8f7340","resolution":{"observed_at":"2026-07-08T02:04:27.085769Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.082752Z","title":"Look into person: Self-supervised structure-sensitive learning and a new benchmark for human parsing","venue":null,"work_id":"4c2ac74b-e940-442a-b778-5cb946c8b267","year":2017},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":52,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:8be8ba87cb6165dbdbd63a87c0e7f1b46e9043e359c764e940b0e91edf0afd82","observation_id":"d1ad69f4-5c69-4349-8258-95dad91400a9","resolution":{"observed_at":"2026-07-08T02:04:27.084015Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.059087Z","title":"Instance-level human parsing via part grouping network","venue":null,"work_id":"ce9ef803-e8ff-470a-9884-c68706467382","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":53,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:7d5963dbd15940fa9f0b2d3760a6ebb5a95f08650b9d33278033cd693d999520","observation_id":"72d53621-0981-4ff4-a260-eb87b6e2b67e","resolution":{"observed_at":"2026-07-08T02:04:27.060503Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.026685Z","title":"LVIS: A dataset for large vocabulary instance segmentation","venue":null,"work_id":"934aceb0-221e-413e-8bbe-f59976b46ec8","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":54,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1c0b2bab4c9b1ffebe6e4b3e702e92895f1d207ef6927c323665bd8ce76b72ac","observation_id":"eb240ce4-dd34-4035-bf62-b07c17e33431","resolution":{"observed_at":"2026-07-08T02:04:27.028249Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.004543Z","title":"Synthetic data for text localisation in natural images","venue":null,"work_id":"8a0d0773-6777-4046-9c4d-0adadc8cd1f0","year":2016},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":55,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:2aa993c59a98907958fe5e25f91bd69de9cb7bbc35ad7a6e5d15ef04401e255b","observation_id":"40c041f1-e2f4-4f02-93a0-6372f678b722","resolution":{"observed_at":"2026-07-08T02:04:27.005728Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.296506","doi":"10.1109/lra.2020.2965061","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"MinneApple: A Benchmark Dataset for Apple Detection and Segmentation.IEEE Robotics and Automation Letters, 5(2):852–858","venue":"IEEE Robotics and Automation Letters","work_id":"97545fa8-119c-4a72-adf8-ee612fe2b23a","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":56,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:bc822a66938f7eaa09fe8786bb40c998cddd0f699039642056e18aac6f9cfd78","observation_id":"fa3296e9-e6d1-4c61-a58e-3b39c3c6c154","resolution":{"observed_at":"2026-07-08T02:04:26.075842Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:23.707577+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:23.707577+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2512.01030","last_updated":"2026-05-18T02:06:07Z","snapshot_observed_at":"2026-07-06T22:37:21.536027Z","submitted_at":"2025-11-30T18:57:25Z","title":"Lotus-2: Advancing Geometric Dense Prediction with Powerful Image Generative Model","version":3},"cited_work":{"arxiv_id":"2512.01030","doi":null,"metadata_source":"pith","pith_arxiv_id":"2512.01030","snapshot_observed_at":"2026-07-08T02:04:26.376621Z","title":"arXiv preprint arXiv:2512.01030 (2025) 30","venue":"cs.CV","work_id":"35dcd687-ee1e-4e3a-bcd4-710f09a90f5f","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":57,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2512.01030","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b270845fbe48544ece44ff1acd80fb33402f75114a1d6a6aea00b468e2c18bae","observation_id":"4bc79d60-2b56-4ac4-be46-df1fa376dc8b","resolution":{"observed_at":"2026-07-08T02:04:26.377903Z","resolver_source":"local_arxiv","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.642598Z","title":"Lotus: Diffusion-based visual foundation model for high-quality dense prediction","venue":null,"work_id":"58533485-1be4-4108-91c4-3b80267ebb45","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":58,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:ba0bdda139a808dce55ee098a63d5a8779e7aac31db9226d2a6e45d6123be971","observation_id":"3128bc55-143c-45ad-9479-1ec153480ef9","resolution":{"observed_at":"2026-07-08T02:14:26.643819Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2112.00933","last_updated":"2022-12-16T19:18:33Z","snapshot_observed_at":"2026-07-06T12:14:24.842188Z","submitted_at":"2021-12-02T02:12:03Z","title":"PartImageNet: A Large, High-Quality Dataset of Parts","version":3},"cited_work":{"arxiv_id":"2112.00933","doi":null,"metadata_source":"pith","pith_arxiv_id":"2112.00933","snapshot_observed_at":"2026-07-08T02:04:26.387328Z","title":"Partimagenet: A large, high-quality dataset of parts","venue":"cs.CV","work_id":"6f638799-983e-47c9-9b8f-f095e8a35c1f","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":59,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2112.00933","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:084e1053d0018b2e4103886531c8238f115e9cb869ef60cfd4cb811be7aaccb4","observation_id":"99a0fb86-acbd-4a19-975e-0520e22fbe92","resolution":{"observed_at":"2026-07-08T02:04:26.388942Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.110181Z","title":"Partimagenet: A large, high-quality dataset of parts","venue":null,"work_id":"9511253d-954a-4011-b43c-b6a28e5eb3c8","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":60,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:60176899ef8f1c9c33dfe753bf75c6159fe0c4d0cad7be2ab551038a330c0e0c","observation_id":"862e2637-35dc-4807-b733-54f0949e4576","resolution":{"observed_at":"2026-07-08T02:04:27.112008Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.667019Z","title":"Mask R-CNN","venue":null,"work_id":"28ce04de-d6e5-45de-a14d-b331706c7763","year":2017},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":61,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:22f71a39da5f864aa3f5a4cafbee3670c02909bc698a8187617f52dcd9e3f2f9","observation_id":"e881f11f-8639-4fe1-98cf-36236f41122f","resolution":{"observed_at":"2026-07-08T02:14:26.668338Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.115785Z","title":"Masked autoencoders are scalable vision learners","venue":null,"work_id":"1f4aff64-77f1-4ad1-940a-be1faa293ecc","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":62,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:c58651221a7fac5e0e6cd129e307cf2fa3cb5d0c866b1749f3b7729993e25248","observation_id":"16d2dfac-bdbf-4f01-93bf-26727d7ba2de","resolution":{"observed_at":"2026-07-08T02:04:27.117270Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2018.854614","doi":"10.1109/icpr.2018.8546143","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Icpr2018 contest on robust reading for multi-type web images","venue":null,"work_id":"cb1a2889-4beb-49b0-862a-63b4ed5dd97e","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":63,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:6ae84d8e643531ce0d069c7acf1e60447807a5dcdf1aa629e4d6a9f421a0fd93","observation_id":"d04fc53f-6234-4d9f-a055-b34ad9fec609","resolution":{"observed_at":"2026-07-08T02:04:26.044821Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:24.144967+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:24.144967+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.638425Z","title":"Scaling out-of-distribution detection for real-world settings","venue":null,"work_id":"abb04516-846d-40d7-ae61-719155bcc518","year":2022},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":64,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:ecb40b02c82aa927e5b2f4ff98221f102320e7c934243a82f6ccdf8f25922d11","observation_id":"358a424d-c711-4c7a-b80c-e7bd93b062d7","resolution":{"observed_at":"2026-07-08T02:14:26.639572Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.626924Z","title":"Lvis fruits and vegetables","venue":null,"work_id":"00a18083-066a-4f91-b2de-a8719ca3ab56","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":65,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:0c6e7d928090d723c50fca43fcc16efaa4b107d7fd3c7bb2ee7c65273d05207c","observation_id":"3d017355-2ba4-49c2-898f-78bc3c125515","resolution":{"observed_at":"2026-07-08T02:14:26.628069Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.112858Z","title":"Denoising diffusion probabilistic models","venue":null,"work_id":"a4178cae-7f76-423a-95a5-760e362d55a2","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":66,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:0bb4dea96e753ba6845712c87081b84011b95b6ff68a371d5525ce27bbc18771","observation_id":"e5438663-a401-4db8-9c7b-8b5398122582","resolution":{"observed_at":"2026-07-08T02:04:27.114760Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2007.08097","last_updated":"2020-07-16T04:19:06Z","snapshot_observed_at":"2026-07-06T09:38:41.713097Z","submitted_at":"2020-07-16T04:19:06Z","title":"TrashCan: A Semantically-Segmented Dataset towards Visual Detection of Marine Debris","version":1},"cited_work":{"arxiv_id":"2007.08097","doi":null,"metadata_source":"pith","pith_arxiv_id":"2007.08097","snapshot_observed_at":"2026-07-08T02:04:26.403825Z","title":"Trash- can: A semantically-segmented dataset towards visual de- tection of marine debris","venue":"cs.CV","work_id":"af00f8c1-8ee2-41a8-b3c1-76ef2b93b9ee","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":67,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2007.08097","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:397714bb7c2cb8dc1ac659975c1e3e99b546401fe51abe5fb85170271e61f42d","observation_id":"75391a31-7bdd-4226-8276-38f7377ad0eb","resolution":{"observed_at":"2026-07-08T02:04:26.405271Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.122755Z","title":null,"venue":null,"work_id":"dd5452fe-7ccc-49c1-ab9b-1cb23ac19976","year":2017},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":68,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f36f2d8edd35cb7e66c0466e2c56a06c14860ca513f68030d6d5ec9598a821d2","observation_id":"1e6f2d2a-9387-4d69-b88f-bf03758dce82","resolution":{"observed_at":"2026-07-08T02:04:27.124011Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.091939Z","title":"G 2VLM: Geometry grounded vision language model with unified 3d reconstruction and spatial reasoning","venue":null,"work_id":"1bf640c6-b8b0-4a20-b63d-748209c30f4a","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":69,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b65faaea62ef9bbd237631977d1c6961aed89c10a9dfb6ead7f49b05ee50d209","observation_id":"7e52e22a-660c-4de5-a90e-a80278efab66","resolution":{"observed_at":"2026-07-08T02:04:27.093203Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.014251Z","title":"Deepmvs: Learning multi-view stereopsis","venue":null,"work_id":"5f95d771-10da-4891-ac2b-2f7500834156","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":70,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a4a3ef8dd87cebd3b48724f56299d82a4054da1f3e6009f6ad5f14baa829ed88","observation_id":"77dee460-54a9-484d-a851-f4805a40c75c","resolution":{"observed_at":"2026-07-08T02:04:27.016009Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2019.00244","doi":"10.1109/cvpr.2019.00244","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Semantic image synthesis with spatially-adaptive normalization","venue":null,"work_id":"4a2b75b8-c883-440b-8b0e-8cd3a3d03cae","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":71,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:95d436a9896862c7979233cf5085de816f67d172d81d6283f94ccd2e715d64c3","observation_id":"b5549b05-b2b1-4b9b-bc88-9a3f8a640b45","resolution":{"observed_at":"2026-07-08T02:04:26.054930Z","resolver_source":"arxiv_id","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.116615Z","title":"Semantic Segmentation of Underwater Imagery: Dataset and Benchmark","venue":null,"work_id":"ee2e4462-34ed-4c36-8d8d-2b761772ef2d","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":72,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:faa3f4a9cf3ba33b6f21dc2913d7a5501f22afef40e9bb4bf0d59a6b315d5015","observation_id":"a8c9f7b0-0306-4871-be61-c30c980cc2ca","resolution":{"observed_at":"2026-07-08T02:04:27.118162Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/cvpr","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-09T16:56:21.584097Z","title":"2016.280","venue":null,"work_id":"45b0bfd8-65dc-4252-b2ab-2f6b411d04d0","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":73,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:d2ec043158bf91cd18c26940e04bb63d581013c9d8386d7721f00923d286fff8","observation_id":"c8d3d9f0-0888-4759-8f98-c67a3d536e03","resolution":{"observed_at":"2026-07-08T02:04:26.036466Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1007/978-3-030-58452-8","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Communications of the ACM 65(1), 99–106 (2021) https://doi.org/ 10.1007/978-3-030-58452-8 24","venue":"Lecture notes in computer science","work_id":"a1e2c1df-293f-40ff-816b-6ba9630f406b","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":74,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:d677786936720824d059ae953be5d5e5992d7ed2e5a7c969a95031bbbb671b7d","observation_id":"c5f07d0f-4837-4124-8952-06876dbc2227","resolution":{"observed_at":"2026-07-08T02:04:26.034109Z","resolver_source":"doi","status":"metadata_mismatch"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:24.926489+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:24.926489+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.099776Z","title":"Megasynth: Scaling up 3d scene reconstruction with synthesized data,","venue":null,"work_id":"8133ebbd-ba2c-41e1-91f5-4a46d2d395ae","year":null},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":75,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b05e76879f7b30f060b8f707acd0f9027abe6bb8c9dc30af31006ae69b959dad","observation_id":"b5777c8a-499d-4155-b36f-cddd5cfe3f2b","resolution":{"observed_at":"2026-07-08T02:04:27.101611Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2412.14166","last_updated":"2025-02-24T06:06:52Z","snapshot_observed_at":"2026-07-06T20:09:28.763595Z","submitted_at":"2024-12-18T18:59:38Z","title":"MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data","version":2},"cited_work":{"arxiv_id":"2412.14166","doi":null,"metadata_source":"pith","pith_arxiv_id":"2412.14166","snapshot_observed_at":"2026-07-08T02:04:26.348763Z","title":"MegaSynth: Scaling Up 3D Scene Reconstruction with Synthesized Data","venue":"cs.CV","work_id":"0626269f-fb22-4519-8431-b0855bdba33c","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":76,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2412.14166","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:38d926d70c20693e77dbc126ea7b3e20925b2d0c2a766824c874e2392dd05fdf","observation_id":"421d11e2-10f3-40a8-8811-24f9ccc84ee4","resolution":{"observed_at":"2026-07-08T02:04:26.350257Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2411.18363","last_updated":"2025-03-11T14:19:42Z","snapshot_observed_at":"2026-08-02T05:48:34.429861Z","submitted_at":"2024-11-27T14:11:10Z","title":"ChatRex: Taming Multimodal LLM for Joint Perception and Understanding","version":3},"cited_work":{"arxiv_id":"2411.18363","doi":null,"metadata_source":"pith","pith_arxiv_id":"2411.18363","snapshot_observed_at":"2026-07-08T02:04:26.359777Z","title":"ChatRex: Tam- ing Multimodal LLM for Joint Perception and Understand- ing","venue":"cs.CV","work_id":"cbe35785-bcf2-4e90-839c-979d39a086fa","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":77,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2411.18363","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:508f1933874b0fd216e015e0d2e7fa8e75215516d804ddf314c15b1e49cee483","observation_id":"bd0898ff-794f-494b-91c6-da4a1dec1311","resolution":{"observed_at":"2026-07-08T02:04:26.361272Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.703434Z","title":"Detect anything via next point prediction","venue":null,"work_id":"e091a7ac-a717-487f-b908-b77ee9206cf5","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":78,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:6c6171a20721288ba57b56e970c1e1e18adf254d26782f64812b8b1de88738ef","observation_id":"2d97a606-4e5b-4792-8af5-7aceaa92d4a2","resolution":{"observed_at":"2026-07-08T02:14:26.704588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"2104.04606","last_updated":"2021-10-26T04:51:57Z","snapshot_observed_at":"2026-08-02T02:23:21.012528Z","submitted_at":"2021-04-09T21:15:34Z","title":"RaidaR: A Rich Annotated Image Dataset of Rainy Street Scenes","version":3},"cited_work":{"arxiv_id":"2104.04606","doi":null,"metadata_source":"pith","pith_arxiv_id":"2104.04606","snapshot_observed_at":"2026-07-08T02:04:26.448156Z","title":"RaidaR: A Rich Annotated Image Dataset of Rainy Street Scenes","venue":"cs.CV","work_id":"1630fb59-5234-44d5-9d53-ed720fff86db","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":79,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/2104.04606","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:5dee166fbf5e9991be2ab538f3cdfe88d7acc98f37add6a5b1d26d1d5feed728","observation_id":"093db996-1565-4ea3-be6e-bffac95dcd92","resolution":{"observed_at":"2026-07-08T02:04:26.449387Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.683302Z","title":"Ultralytics datasets: Medical-pills detection dataset, Dec 2024","venue":null,"work_id":"301835b7-2639-468c-8dc1-f9d8ca19edeb","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":80,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:178ad050e8bfde068874808d3f2d6844bf104d944146ebec872c4228274d4986","observation_id":"245d09a2-bcab-49cc-821c-849248a7bce2","resolution":{"observed_at":"2026-07-08T02:14:26.684508Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.046058Z","title":"Ultralytics datasets: Homeobjects-3k detection dataset, May 2025","venue":null,"work_id":"436eac68-7b3e-4fbf-aca5-4945ab8ca2ac","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":81,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:37e50a1eec2f794bfa167b6c6bb8c9ecb7c9e8a4840f42ace57d758200abc2ee","observation_id":"7d610b34-3d97-4f9d-9fba-96d63b3d567e","resolution":{"observed_at":"2026-07-08T02:04:27.048239Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:14:26.694681Z","title":"Human-art: A versatile human-centric dataset bridging natural and artificial scenes","venue":null,"work_id":"da5bd45f-8220-406a-b5a6-c64a4d0c89bc","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":82,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:f0c992e4de97cb60800b7a2615ca677b7f7a14c65f7edbde4c3e108ddd877b7f","observation_id":"b74be24a-f932-4d7e-8d37-5d11d7082ffc","resolution":{"observed_at":"2026-07-08T02:14:26.695974Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.1109/icdar","metadata_source":"doi_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.019263Z","title":"Cloppet, V","venue":null,"work_id":"de8bb2fc-f40a-4ad2-85dd-f14f6b18bdd6","year":2013},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":83,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:d0beba9558f8e39d0fbe245db14ce334e4387e11c13af68672ba3cb9c0ea91e8","observation_id":"a079404a-0c3b-4bd7-a37e-0503128c7408","resolution":{"observed_at":"2026-07-08T02:04:26.020922Z","resolver_source":"doi_truncated","status":"malformed_identifier"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2015.733394","doi":"10.1109/icdar.2015.7333942","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"Icdar 2015 competition on robust reading","venue":null,"work_id":"42186fe1-0504-415e-8b73-26e0aae21b3a","year":2015},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":84,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:e30d19c9733aae09517b5b6fe0f998e61d415a5f791e9b7f329053be018d093b","observation_id":"376882d1-4e31-48a6-a018-e8a123872785","resolution":{"observed_at":"2026-07-08T02:04:26.072891Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:25.350052+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:25.350052+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":"10.3115/v1/d14-1086","metadata_source":"openalex","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"ReferItGame: Referring to Objects in Photographs of Natural Scenes","venue":null,"work_id":"80724872-c43a-4cd3-8459-76b231872b7c","year":2014},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":85,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:a59676b11aa2f598a9161aabd5767e57804b93e75986276f30104c677b2f1df1","observation_id":"99111827-049d-493e-a7d7-40bf5e3e6797","resolution":{"observed_at":"2026-07-08T02:04:26.069720Z","resolver_source":"doi","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:25.779024+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:25.779024+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.052512Z","title":null,"venue":null,"work_id":"cd56cdd5-39a0-429a-a9a9-9e12931ef9cc","year":2014},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":86,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:da422a9062671160d66840dc8d1c6086a111034b993352b7b841894067753f22","observation_id":"e367475d-0a3b-4948-b037-44a32bedf1e8","resolution":{"observed_at":"2026-07-08T02:04:27.053696Z","resolver_source":"raw_fallback","status":"unresolved"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:26.995273Z","title":"Repurposing diffusion-based image generators for monocular depth estimation","venue":null,"work_id":"5e88e350-d524-4587-96c6-3ff7daacc4a5","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":87,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1e558d51dfbea67cb2a1935e2ced35ec2f5691eb4f40cc725580da4697cc5c96","observation_id":"85b8f798-50d4-43b2-80a4-a8aa9b26ee94","resolution":{"observed_at":"2026-07-08T02:04:26.996543Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.029031Z","title":"MapAnything: Universal feed-forward metric 3D reconstruction","venue":null,"work_id":"1fe76d32-9e7a-4192-9486-d19cde640147","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":88,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:58067024234fde44196ef101f31e5aae5ed3fc6db86dd787229eb4354b54565a","observation_id":"f6f83ed6-b653-4342-b220-448780083cc6","resolution":{"observed_at":"2026-07-08T02:04:27.030764Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.088157Z","title":"Berg, Wan-Yen Lo, Piotr Doll ´ar, and Ross Girshick","venue":null,"work_id":"95d90bcf-ce9a-4d59-af53-2da1412af082","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":89,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b68fa34733a57617362f1e9aecf3302db1f57db2f6a5531fbf5eda1aa5b3bb42","observation_id":"affa4c61-cce0-4945-9e16-831b4ba968cb","resolution":{"observed_at":"2026-07-08T02:04:27.089415Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.070220Z","title":"Waterovs","venue":null,"work_id":"314911f6-30aa-429a-826c-9c82f09314f5","year":2026},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":90,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:20a854fbd8aee8cb0e480ea92ae2edaa1837e2ef76ec2a71486fa90378533813","observation_id":"7bf58d39-baed-4408-9a4d-763284091221","resolution":{"observed_at":"2026-07-08T02:04:27.071524Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.072141Z","title":"A hierarchical grocery store image dataset with visual and semantic labels","venue":null,"work_id":"c47f110e-ff4d-4fc8-be4a-a16fb9fdd48e","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":91,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:87aaa270b8d95c00786f88197bc2cb4f8e6605fb8b2b6cf56efb1c92d810c049","observation_id":"a8366567-8341-4891-929b-6f443c4c8bf9","resolution":{"observed_at":"2026-07-08T02:04:27.073748Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.076715Z","title":"Evaluation of CNN-based single-image depth estimation methods","venue":null,"work_id":"72cf4985-4131-47e8-8a28-0ceb60705c24","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":92,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:d6d9af0f70dfef01640a2677484043ea73d05a40e51ef46cb6e9855c7ce8b269","observation_id":"c451a99c-23e0-4dd8-b5e8-316733be0140","resolution":{"observed_at":"2026-07-08T02:04:27.078159Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.084414Z","title":"shoe-dataset","venue":null,"work_id":"2d31cb1d-2e1e-4355-b066-86e99e216a30","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":93,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:7c2244e4127458219d35bc7693881cacebab776f9e0b8069cbb7133c70632741","observation_id":"33ed5c08-7a36-4cf8-a92c-0c729bc634a1","resolution":{"observed_at":"2026-07-08T02:04:27.085588Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.086293Z","title":"Alet (automated labeling of equipment and tools): A dataset for tool detection and human worker safety detection","venue":null,"work_id":"f45adb0a-563a-489c-b5db-f97637a5a4e3","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":94,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:449edb5cedf32a3e3f98acbc8a412f0f8c52bc19e57baa7854fb2227664da076","observation_id":"59876151-82b1-47ad-8fa5-31720e281e41","resolution":{"observed_at":"2026-07-08T02:04:27.087628Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.066067Z","title":"The open images dataset v4: Unified image classification, object detection, and visual relationship detection at scale","venue":null,"work_id":"876fb84c-ebbc-4ae2-8ffa-1a108d4e96d6","year":2020},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":95,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:2a3bf2c69cda3cac11a80e795cd8a37e99cc40b2ef78d71755594c78f6059c11","observation_id":"d22093b2-c380-4690-96b8-646fcd3b29b8","resolution":{"observed_at":"2026-07-08T02:04:27.067549Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":"2020.581154","doi":"10.3389/fnbeh.2020.581154","metadata_source":"arxiv_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-08-05T02:28:24.338817Z","title":"in the wild","venue":"Frontiers in Behavioral Neuroscience","work_id":"0ed1acae-46d6-435b-a7c3-2ee419bdc78f","year":2021},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":96,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:b374d10cde77083991b58c3175289f1d78b603261c0bb05b457cfc518e3c5122","observation_id":"53d178ea-1d2e-4b0c-9228-f410689b5951","resolution":{"observed_at":"2026-07-08T02:04:26.079301Z","resolver_source":"arxiv_id","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-07-10T17:49:26.223004+00:00","source":"crossref_status_cache"},{"observed_at":"2026-07-10T17:49:26.223004+00:00","source":"openalex_status_cache"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.080720Z","title":"LISA: Reasoning segmentation via large language model","venue":null,"work_id":"0e0f617c-b0e1-4a2c-9ccc-a04bdc739279","year":2024},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":97,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:1e22fd27f492defa36c5cac42d91720567becddd3698b5512fdd8439185b229b","observation_id":"4ced6689-14ef-408d-991b-e00a87385d3f","resolution":{"observed_at":"2026-07-08T02:04:27.082044Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.061568Z","title":"Text4Seg: Reimagining image segmentation as text generation","venue":null,"work_id":"58ac1284-237b-4ccb-8f7c-ccbfd35462cd","year":2025},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":98,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:4f49401b3e39fb2824af7a58d4869dd7c30a74722d96a290d8d24b4064804822","observation_id":"98e17c95-466f-4ffa-91d9-471890444613","resolution":{"observed_at":"2026-07-08T02:04:27.062902Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.070506Z","title":"Uni-Perceiver v2: A generalist model for large-scale vision and vision-language tasks","venue":null,"work_id":"b453d05c-cafa-48e7-adf3-03b9c20af492","year":2023},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":99,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:e3852bbab60084803c697e0e55b5bdd933557b6225395a6ef29c48b8499834d7","observation_id":"621538ba-4de9-4106-aa03-8be5f884392c","resolution":{"observed_at":"2026-07-08T02:04:27.071702Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":{"arxiv_id":"1812.00324","last_updated":"2019-01-23T03:53:48Z","snapshot_observed_at":"2026-08-01T19:41:30.058471Z","submitted_at":"2018-12-02T04:40:40Z","title":"CrowdPose: Efficient Crowded Scenes Pose Estimation and A New Benchmark","version":2},"cited_work":{"arxiv_id":"1812.00324","doi":null,"metadata_source":"pith","pith_arxiv_id":"1812.00324","snapshot_observed_at":"2026-07-08T02:04:26.311344Z","title":"CrowdPose: Efficient Crowded Scenes Pose Estimation and A New Benchmark","venue":"cs.CV","work_id":"73fe3679-8401-45dc-ab0b-3f269a75f263","year":2018},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":100,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"cited_paper":"/paper/1812.00324","citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:71472f9651e945bc882b940127440d8cbf185c9bff9e6086d785c45249230b4c","observation_id":"64076dd6-dcaa-441d-8aa4-f3a38dc63264","resolution":{"observed_at":"2026-07-08T02:04:26.312887Z","resolver_source":"local_arxiv","status":"verified_exact"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":"raw_reference","pith_arxiv_id":null,"snapshot_observed_at":"2026-07-08T02:04:27.078900Z","title":"Tablebank: A benchmark dataset for table detection and recognition, 2019","venue":null,"work_id":"18ae8d37-ece4-48ea-98dc-2c7c87b58d1e","year":2019},"citing_paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation","version":1},"reference_index":101,"source":"pdf_text","source_observed_at":"2026-07-08T01:54:30.649092Z"},"links":{"citing_paper":"/paper/2607.06560"},"observation_digest":"sha256:af781bfb21475d27601ee5bdc1ee14b12420140512c7cd398b055f6674cf8742","observation_id":"05b4fd5e-cd60-444e-a7ca-02df13f12593","resolution":{"observed_at":"2026-07-08T02:04:27.080328Z","resolver_source":"raw_fallback","status":"verified_fuzzy"},"standing_notice":{"events":[],"observation":"No event found in the named queried sources as of 2026-08-05T06:32:48.257954+00:00.","reason":null,"source_receipts":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"state":"measured"}}],"paper":{"arxiv_id":"2607.06560","last_updated":"2026-07-07T17:58:33Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-10T23:18:28.655344Z","submitted_at":"2026-07-07T17:58:33Z","title":"Vision as Unified Multimodal Generation"},"reference_resolution":{"displayed":100,"state_counts":{"malformed_identifier":3,"metadata_mismatch":4,"parse_uncertain":0,"unresolved":5,"verified_exact":29,"verified_fuzzy":59},"total_outbound_references":231},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-05T06:32:48.257954+00:00","source":"crossref"},{"observed_at":"2026-08-05T06:32:44.755628+00:00","source":"retraction_watch"}],"thesis":"As of 5 August 2026, this Paper Citation Record lists 100 of 231 outbound references and 1 inbound Pith citation observation for arXiv:2607.06560."}