{"as_of":"2026-08-07T19:46:00Z","caps":{"database_statements":6,"inbound":100,"outbound":100},"context_digest":"sha256:a773146fcca33af2618d27babe18f743f3ce79ebd6644150be3a14f5ccdcf112","coverage":[{"denominator":23,"lane":"reference_resolution","note":"Typed states for the displayed outbound observations.","records_observed":23,"source":"paper_references, paper_reference_links","source_observed_at":"2026-07-31T15:44:28.204969Z","state":"measured"},{"denominator":23,"lane":"standing_notices","note":"One-hop event checks from named stored sources.","records_observed":23,"source":"scholarly_work_events, retraction_status_cache","source_observed_at":"2026-08-07T06:34:17.273281+00:00","state":"measured"},{"denominator":0,"lane":"inbound_itemization","note":"Pith citing papers itemized under the disclosed page cap.","records_observed":0,"source":"paper_references, paper_reference_links","source_observed_at":null,"state":"measured"},{"denominator":1,"lane":"external_citation_measurements","note":"A source-named dated measurement, never combined with another source.","records_observed":0,"source":"cited_works","source_observed_at":null,"state":"measured"}],"external_citation_measurements":[],"inbound":[],"links":{"evidence":"/evidence","html":"/paper/2607.24407/citation-record","integrity":"/paper/2607.24407/integrity","json":"/paper/2607.24407/citation-record.json","paper":"/paper/2607.24407"},"outbound":[{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.147533Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":1,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.147533Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:886bf664e917cf8c1756cf5dcc6de47cb8cfead215fc11272f2884fd90f4c4b1","observation_id":"eecb9ee0-7889-4866-ba21-0b09db89d1fc","resolution":{"observed_at":"2026-07-31T15:44:28.147533Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.150978Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":2,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.150978Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:01d68356b2bde16aea74f1630aaf202b636529cec04b5c2a511ecd29b2f3fee4","observation_id":"c5e66dc9-616e-4629-bef3-29870bf1100f","resolution":{"observed_at":"2026-07-31T15:44:28.150978Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.153719Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":3,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.153719Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:c9512be0c44affe3ef90c555d91bf5108d388f1ccf19fe51ce315c33ee9938b8","observation_id":"72eae22a-cd5c-4ceb-85be-1f4f5a5bd9d4","resolution":{"observed_at":"2026-07-31T15:44:28.153719Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.156338Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":4,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.156338Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:b658a177163ab0b0f776e14d1ee7986dd5e7972a8daf608d70b5852d9446e92d","observation_id":"b6307e0e-7894-4be4-91f9-f7d436b4f340","resolution":{"observed_at":"2026-07-31T15:44:28.156338Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.159023Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":5,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.159023Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:329578777d44e3a6b0e87765e543188a9a1f846ebacb8e4edd4ca424f1d896a8","observation_id":"b8874a13-7ef8-4730-a1d6-3b2cb93b4521","resolution":{"observed_at":"2026-07-31T15:44:28.159023Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.161801Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":6,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.161801Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:aa1776e36d3ff76611ca9c75e5b2a820408a22bbf2d948eaff208739758323be","observation_id":"9e1cc2b1-243b-4d24-894c-3915299cc70e","resolution":{"observed_at":"2026-07-31T15:44:28.161801Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.164735Z","title":"Direct Grounding Prompt Reflection Prompt You are an expert multimodal grounding annotator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":7,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.164735Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:e28402a80652ac9ffeb26b0fe7a93a8a1f5e9e54f791763b3c8931bc3814d583","observation_id":"392f1e59-6d56-4cd5-b2aa-f8c18b7eb700","resolution":{"observed_at":"2026-07-31T15:44:28.164735Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.169363Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":9,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.169363Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:b940bdd132cc2e7c771be9feedc74e25d088945a594bf645235c83f397c46abd","observation_id":"f2679ebe-d20d-4648-a34c-70886b3833cc","resolution":{"observed_at":"2026-07-31T15:44:28.169363Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.171632Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":10,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.171632Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:09f71cdc3bc68328d082cf52a18d70cfd0c76ea8fcb213773d990e9add148f59","observation_id":"3389078a-37d2-4cd3-9ce4-e162a9cfd276","resolution":{"observed_at":"2026-07-31T15:44:28.171632Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.173914Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":11,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.173914Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:d00277e4ba8324266b8eb8a1cc311a1070ef118209b41613839d136bf85302d5","observation_id":"00af1e62-d1bd-4a96-ab43-b6b091a17aa0","resolution":{"observed_at":"2026-07-31T15:44:28.173914Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.176556Z","title":"You are an expert multimodal grounding annotator","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":12,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.176556Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:157f63ae699a3209b8e00d479804bbb21317406d96deeb2c4198d182a1f2a78a","observation_id":"de6bfa11-1969-46fe-917a-c6d34adfe218","resolution":{"observed_at":"2026-07-31T15:44:28.176556Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.178723Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":13,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.178723Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:36870743fab050d854d003715671618419085efc5a477fa747156e8038ab2457","observation_id":"d4f65a20-4eb6-46a4-baff-ee8a189dd412","resolution":{"observed_at":"2026-07-31T15:44:28.178723Z","resolver_source":null,"status":"parse_uncertain"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.181024Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":14,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.181024Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:3362588cc1deef64acb3a568da0c7c4985755e53715adb45c0648a0cd102b5ce","observation_id":"5a45f584-2ef5-49c5-893d-d890defc97cc","resolution":{"observed_at":"2026-07-31T15:44:28.181024Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.183340Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":15,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.183340Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:73a30f6ce35c2f03b04344b47bac9bef18458b259aa3bdf55ec435bd4f5a36bb","observation_id":"ade672cf-40e5-4c9a-b3fc-b10c2b256f8c","resolution":{"observed_at":"2026-07-31T15:44:28.183340Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.185655Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":16,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.185655Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:e96bedefa64c70f73344144609b20e5a5e048d7b8181dc1c79363fdc2cdc261e","observation_id":"de7a5527-3be0-4686-af8a-af1c00374736","resolution":{"observed_at":"2026-07-31T15:44:28.185655Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.188031Z","title":null,"venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":17,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.188031Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:89425fb0937dc926f261a22983d09ab8e65c3d8544a9a26497a52e9477e0586d","observation_id":"ec973c2e-d77c-4d1d-93b1-c16eda5ec49d","resolution":{"observed_at":"2026-07-31T15:44:28.188031Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.190210Z","title":"Evidence Diagnosis Prompt Figure 8Prompt templates used in referring grounding data construction","venue":null,"work_id":null,"year":2026},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":18,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.190210Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:6f6e42cb870f2877d9969eb67b6c0da7f6830e908eb8bc360e015b14ad969383","observation_id":"6127bcc5-98cb-4594-8cbd-39d4b65425ba","resolution":{"observed_at":"2026-07-31T15:44:28.190210Z","resolver_source":null,"status":"malformed_identifier"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.193532Z","title":"Assign a clear and concise class label to each object (e.g., 'person', 'laptop', 'coffee mug', 'dog’)","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":19,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.193532Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:3f75c1e6ce13bc63a615ef3755d3d6fc2bb8a4941115dd976a1340f155e59cd2","observation_id":"f5f7940f-18e9-46a9-bd35-fb7e6c3f0c02","resolution":{"observed_at":"2026-07-31T15:44:28.193532Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.195768Z","title":"Each instance requires its own property dictionary","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":20,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.195768Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:fdce2dcd6705fbd615e28cf5c06b61743f28fed280af28e501dd3b740afc7539","observation_id":"4c3e23ce-c607-4369-bd59-f04259601b66","resolution":{"observed_at":"2026-07-31T15:44:28.195768Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.197963Z","title":"Populate this object with all observable visual properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":21,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.197963Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:d2f965b862a5ddf7ecb99239b6313f0fed0d9e3bc8a2c94de1a2e29da8f81c1f","observation_id":"7a5ae56a-ba3c-4ec8-9e36-a01c48611bad","resolution":{"observed_at":"2026-07-31T15:44:28.197963Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.200326Z","title":"to the left of the monitor","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":22,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.200326Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:2f3606fdfe14d959f005c5b32c954fe80b21f31df11a01d65c725851e7e97a0d","observation_id":"544a2b64-8b45-4217-a012-dc142ac14e74","resolution":{"observed_at":"2026-07-31T15:44:28.200326Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.202547Z","title":"a white ceramic mug filled with dark coffee","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":23,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.202547Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:86902ce7ce75bc9a3133cae5a3814e672754df1f2637fd8a4103a254a1bbaa15","observation_id":"48bee4ce-e966-42c0-8e37-1aa6652fb9a5","resolution":{"observed_at":"2026-07-31T15:44:28.202547Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}},{"citation":{"cited_paper":null,"cited_work":{"arxiv_id":null,"doi":null,"metadata_source":null,"pith_arxiv_id":null,"snapshot_observed_at":"2026-07-31T15:44:28.204969Z","title":"scene_properties","venue":null,"work_id":null,"year":null},"citing_paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding","version":1},"reference_index":24,"source":"pdf_text","source_observed_at":"2026-07-31T15:44:28.204969Z"},"links":{"citing_paper":"/paper/2607.24407"},"observation_digest":"sha256:fecd27e7c71562507036e265fff73543076bf50e3dd17fa7175851d54d1c909f","observation_id":"82c90e8b-771f-49dd-9056-2f8681840651","resolution":{"observed_at":"2026-07-31T15:44:28.204969Z","resolver_source":null,"status":"unresolved"},"standing_notice":{"events":[],"reason":"canonical_work_link_unavailable","source_receipts":[],"state":"unavailable"}}],"paper":{"arxiv_id":"2607.24407","last_updated":"2026-07-27T13:24:35Z","latest_version":1,"primary_category":"cs.CV","snapshot_observed_at":"2026-07-31T15:44:26.472007Z","submitted_at":"2026-07-27T13:24:35Z","title":"Mixture-of-Thought-Tokens: Unifying Perception and Reasoning for Free-form Multimodal Grounding"},"reference_resolution":{"displayed":23,"state_counts":{"malformed_identifier":1,"metadata_mismatch":0,"parse_uncertain":1,"unresolved":21,"verified_exact":0,"verified_fuzzy":0},"total_outbound_references":23},"refusal":"A citation records a reference. It does not transfer a finding from one paper to another.","schema":"pith.paper-citation-record.v1","standing_sources":[{"observed_at":"2026-08-07T06:34:17.273281+00:00","source":"crossref"},{"observed_at":"2026-08-07T06:34:11.927384+00:00","source":"retraction_watch"}],"thesis":"As of 7 August 2026, this Paper Citation Record lists 23 of 23 outbound references and 0 inbound Pith citation observations for arXiv:2607.24407."}