3月22日,腾讯混元昨晚宣布,正式推出自研深度思考模型混元T1正式版。
据介绍,「T1」吐字快、能秒回,还擅长超长文处理,是腾讯自研的强推理模型。通过大规模强化学习,并结合数学、逻辑推理、科学和代码等理科难题的专项优化,混元T1正式版进一步提升了推理能力。
混元T1正式版沿用了混元Turbo S的创新架构,采用Hybrid-Mamba-Transformer 融合模式。这一架构有效降低了传统Transformer结构的计算复杂度,减少了KV-Cache的内存占用,从而显著降低了训练和推理成本。
基于长文捕捉能力,混元T1能有效解决长文推理中常见的上下文丢失和长距离信息依赖问题。同时,混合Mamba架构针对长序列处理进行了专项优化,通过高效的计算方式,在确保长文本信息捕捉能力的同时大幅降低资源消耗,在相近的激活参数量下,实现了解码速度提升2倍。
相关文章
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读
2025-03-2211阅读