{"record_type":"pith_number_record","schema_url":"https://pith.science/schemas/pith-number/v1.json","pith_number":"pith:2023:HEYNZHWONO67MJNNXWOBFTSAAI","short_pith_number":"pith:HEYNZHWO","schema_version":"1.0","canonical_sha256":"3930dc9ece6bbdf625adbd9c12ce400237a841ffe1f3dc69207f315261cf6a20","source":{"kind":"arxiv","id":"2311.04498","version":4},"attestation_state":"computed","paper":{"title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Ao Zhang, Tat-Seng Chua, Wei Ji, Yuan Yao, Zhiyuan Liu","submitted_at":"2023-11-08T07:15:05Z","abstract_excerpt":"The development of large language models (LLMs) has greatly advanced the field of multimodal understanding, leading to the emergence of large multimodal models (LMMs). In order to enhance the level of visual comprehension, recent studies have equipped LMMs with region-level understanding capabilities by representing object bounding box coordinates as a series of text sequences (pix2seq). In this paper, we introduce a novel paradigm for object location modeling called pix2emb method, where we ask the LMM to output the location embeddings and then decode them with different decoders. This paradi"},"verification_status":{"content_addressed":true,"pith_receipt":true,"author_attested":false,"weak_author_claims":0,"strong_author_claims":0,"externally_anchored":false,"storage_verified":false,"citation_signatures":0,"replication_records":0,"graph_snapshot":true,"references_resolved":false,"formal_links_present":false},"canonical_record":{"source":{"id":"2311.04498","kind":"arxiv","version":4},"metadata":{"license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","primary_cat":"cs.CV","submitted_at":"2023-11-08T07:15:05Z","cross_cats_sorted":["cs.AI","cs.CL"],"title_canon_sha256":"c71df9c58ecc3cd3ce33e03f03fe5771edd55047c7563742f721e2ae18dc5f82","abstract_canon_sha256":"b8ab5471e0a011e69ed7d088a04a2ef309a7afeb794995293b4e240e4cac4d8b"},"schema_version":"1.0"},"receipt":{"kind":"pith_receipt","key_id":"pith-v1-2026-05","algorithm":"ed25519","signed_at":"2026-07-05T07:25:26.546465Z","signature_b64":"Y2KTHz0xwsVxrRL89SwXU725dRTl+7/EedB24Ymke/zzGdv94pykrhbV15tjw3tMadcNsiaMhe2jsArR0CH/Aw==","signed_message":"canonical_sha256_bytes","builder_version":"pith-number-builder-2026-05-17-v1","receipt_version":"0.3","canonical_sha256":"3930dc9ece6bbdf625adbd9c12ce400237a841ffe1f3dc69207f315261cf6a20","last_reissued_at":"2026-07-05T07:25:26.545996Z","signature_status":"signed_v1","first_computed_at":"2026-07-05T07:25:26.545996Z","public_key_fingerprint":"8d4b5ee74e4693bcd1df2446408b0d54"},"graph_snapshot":{"paper":{"title":"NExT-Chat: An LMM for Chat, Detection and Segmentation","license":"http://arxiv.org/licenses/nonexclusive-distrib/1.0/","headline":"","cross_cats":["cs.AI","cs.CL"],"primary_cat":"cs.CV","authors_text":"Ao Zhang, Tat-Seng Chua, Wei Ji, Yuan Yao, Zhiyuan Liu","submitted_at":"2023-11-08T07:15:05Z","abstract_excerpt":"The development of large language models (LLMs) has greatly advanced the field of multimodal understanding, leading to the emergence of large multimodal models (LMMs). In order to enhance the level of visual comprehension, recent studies have equipped LMMs with region-level understanding capabilities by representing object bounding box coordinates as a series of text sequences (pix2seq). In this paper, we introduce a novel paradigm for object location modeling called pix2emb method, where we ask the LMM to output the location embeddings and then decode them with different decoders. This paradi"},"claims":{"count":0,"items":[],"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"source":{"id":"2311.04498","kind":"arxiv","version":4},"verdict":{"id":null,"model_set":{},"created_at":null,"strongest_claim":"","one_line_summary":"","pipeline_version":null,"weakest_assumption":"","pith_extraction_headline":""},"integrity":{"clean":true,"summary":{"advisory":0,"critical":0,"by_detector":{},"informational":0},"endpoint":"/pith/2311.04498/integrity.json","findings":[],"available":true,"detectors_run":[],"snapshot_sha256":"c28c3603d3b5d939e8dc4c7e95fa8dfce3d595e45f758748cecf8e644a296938"},"references":{"count":0,"sample":[],"resolved_work":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57","internal_anchors":0},"formal_canon":{"evidence_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"author_claims":{"count":0,"strong_count":0,"snapshot_sha256":"258153158e38e3291e3d48162225fcdb2d5a3ed65a07baac614ab91432fd4f57"},"builder_version":"pith-number-builder-2026-05-17-v1"},"aliases":[{"alias_kind":"arxiv","alias_value":"2311.04498","created_at":"2026-07-05T07:25:26.546051+00:00"},{"alias_kind":"arxiv_version","alias_value":"2311.04498v4","created_at":"2026-07-05T07:25:26.546051+00:00"},{"alias_kind":"doi","alias_value":"10.48550/arxiv.2311.04498","created_at":"2026-07-05T07:25:26.546051+00:00"},{"alias_kind":"pith_short_12","alias_value":"HEYNZHWONO67","created_at":"2026-07-05T07:25:26.546051+00:00"},{"alias_kind":"pith_short_16","alias_value":"HEYNZHWONO67MJNN","created_at":"2026-07-05T07:25:26.546051+00:00"},{"alias_kind":"pith_short_8","alias_value":"HEYNZHWO","created_at":"2026-07-05T07:25:26.546051+00:00"}],"events":[],"event_summary":{},"paper_claims":[],"inbound_citations":{"count":8,"internal_anchor_count":0,"sample":[{"citing_arxiv_id":"2606.26196","citing_title":"From Structure to Synergy: A Survey of Vision-Language Perception Paradigm Evolution in Multimodal Large Language Models","ref_index":97,"is_internal_anchor":false},{"citing_arxiv_id":"2606.12195","citing_title":"InternVideo3: Agentify Foundation Models with Multimodal Contextual Reasoning","ref_index":104,"is_internal_anchor":false},{"citing_arxiv_id":"2501.12386","citing_title":"InternVideo2.5: Empowering Video MLLMs with Long and Rich Context Modeling","ref_index":35,"is_internal_anchor":false},{"citing_arxiv_id":"2512.10554","citing_title":"Grounding Everything in Tokens for Multimodal Large Language Models","ref_index":86,"is_internal_anchor":false},{"citing_arxiv_id":"2604.11789","citing_title":"LMMs Meet Object-Centric Vision: Understanding, Segmentation, Editing and Generation","ref_index":223,"is_internal_anchor":false},{"citing_arxiv_id":"2604.07765","citing_title":"RemoteAgent: Bridging Vague Human Intents and Earth Observation with RL-based Agentic MLLMs","ref_index":76,"is_internal_anchor":false},{"citing_arxiv_id":"2408.01800","citing_title":"MiniCPM-V: A GPT-4V Level MLLM on Your Phone","ref_index":116,"is_internal_anchor":false},{"citing_arxiv_id":"2604.18562","citing_title":"AnchorSeg: Language Grounded Query Banks for Reasoning Segmentation","ref_index":196,"is_internal_anchor":false}]},"formal_canon":{"evidence_count":0,"sample":[],"anchors":[]},"links":{"html":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI","json":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI.json","graph_json":"https://pith.science/api/pith-number/HEYNZHWONO67MJNNXWOBFTSAAI/graph.json","events_json":"https://pith.science/api/pith-number/HEYNZHWONO67MJNNXWOBFTSAAI/events.json","paper":"https://pith.science/paper/HEYNZHWO"},"agent_actions":{"view_html":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI","download_json":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI.json","view_paper":"https://pith.science/paper/HEYNZHWO","resolve_alias":"https://pith.science/api/pith-number/resolve?arxiv=2311.04498&json=true","fetch_graph":"https://pith.science/api/pith-number/HEYNZHWONO67MJNNXWOBFTSAAI/graph.json","fetch_events":"https://pith.science/api/pith-number/HEYNZHWONO67MJNNXWOBFTSAAI/events.json","actions":{"anchor_timestamp":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI/action/timestamp_anchor","attest_storage":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI/action/storage_attestation","attest_author":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI/action/author_attestation","sign_citation":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI/action/citation_signature","submit_replication":"https://pith.science/pith/HEYNZHWONO67MJNNXWOBFTSAAI/action/replication_record"}},"created_at":"2026-07-05T07:25:26.546051+00:00","updated_at":"2026-07-05T07:25:26.546051+00:00"}