Workflow
Agent智能体
icon
搜索文档
国泰海通 · 晨报260723|基金研究、机械、银行
公募基金2026年二季报规模点评 - 截至2026年二季度末,公募基金管理总规模(不含货币基金)约为24.05万亿元,较2026年一季度末增加约2.10万亿元 [3] - 剔除ETF联接基金投资于ETF部分及持有内部基金后,公募基金总规模(不含货币基金)约为22.85万亿元,较上一季度增加约2.03万亿元 [3] - 指数基金(被动管理产品)总规模约6.00万亿元,其中权益类(含QDII)规模约4.19万亿元,较前一季度减少约0.28万亿元,固定收益类规模约1.82万亿元,较前一季度增加约0.35万亿元,通信或半导体主题指数基金规模增长居前,而大体量宽基指数产品规模大幅缩水 [3] - 主动权益基金(剔除FOF)规模约5.64万亿元,较上一季度末增加约1.14万亿元,二季度近5成主动权益基金实现规模扩张,投资于科技赛道且净值增长较高的基金规模上涨更为靠前 [4] - 主动债券型基金(剔除FOF)规模达到10.35万亿元,较上一季度末增加约0.87万亿元,含权类债基获得更多关注 [4] - FOF基金规模约为2144.55亿元,较前一季度有所减少,绩优中低仓位FOF产品更受青睐 [5] - 其他类产品(含黄金ETF、REITs等)规模合计约6401.98亿元,较前一季度减少约401.63亿元,其中黄金主题相关ETF规模为2557.97亿元,较前一季度减少约652.32亿元,二季度有8只REITs成立且认购份额较大 [5] WAIC 2026:人形机器人的场景、模型和计算 - 2026世界人工智能大会(WAIC)以“智能伙伴,共创未来”为主题,AI Agent成为关键词,具身智能被视为Agent的终局,行业焦点从模型参数转向Agent智能体的实际落地 [9] - 具身智能在工业、商业、家庭等场景加速落地探索:工业场景涉及仓储物流、汽车线束整理、产线精密装配等;商业场景聚焦无人商店、药店值守、酒店洗衣、餐饮制作等;家庭场景涵盖安防、物品取送、生活陪伴、洗衣叠衣等长线程任务 [10] - 2026年上半年国内具身智能企业发布超20款大模型,行业范式基本收敛,数据被公认为最大壁垒,行业正朝合成数据达亿小时、真机数据达百万小时的目标推进 [11] - 世界模型面临算力、存储、通信三维耦合的系统性计算挑战:算力关键在精度和生成复杂度;存储第一瓶颈是HBM带宽,KV Cache需求膨胀催生层级存储新范式;通信要求推理在微秒级完成,执行在毫秒级反应 [11] 山东19家上市&非上市银行核心经营指标 - 2025年山东省地区生产总值达10.3万亿元,同比增长5.5%,人均GDP为10.26万元,三大产业比例为6.6:39.3:54.1,第三产业占比持续提升,其中批发和零售业占比达26.7% [14] - 2026年5月末,山东省金融机构各项贷款同比增长7.9%,显著高于全国5.4%的平均增速;各项存款同比增长8.5%,与全国8.7%的平均增速大体相当 [14] - 山东省银行体系竞争格局独特:地方法人机构(14家城商行、110家农商行、126家村镇银行)数量居全国前列,国有大行主导大型对公项目,股份行渗透度相对较低 [15] - 规模扩张较快的银行包括:青岛银行(总资产增速18.1%)、齐鲁银行(16.7%)、枣庄银行(14.8%)、威海银行(14.3%);贷款增速较高的有青岛银行(16.6%)、德州银行(16.1%)、枣庄银行(15.9%);金融投资增速突出的有临商银行(30.7%)、东营银行(24.1%)、莱商银行(22.0%) [15] - 金融资产配置结构各异:临商银行(92.1%)、济宁银行(84.8%)、烟台农商行(73.1%)的AC账户占比较高;莱商银行(58.5%)、蓝海银行(55.2%)、日照银行(47.8%)的OCI账户占比较高;利率债投资占比较高的有齐鲁银行(占总资产28.5%)、菏泽农商行(25.4%)、恒丰银行(22.3%);金融债配置比例突出的有烟台银行(19.8%)、烟台农商行(17.7%)、临商银行(15.5%) [16] - 盈利能力与定价:净息差表现突出的有日照银行(1.72%)、威海银行(1.68%)、青岛银行(1.66%),其中日照银行贷款收益率达4.65%;ROE较高的有青岛银行(12.68%)、齐鲁银行(12.17%)、菏泽农商行(11.60%);营收增速领先的有枣庄银行(24.99%)、烟台银行(17.92%)、泰安银行(16.76%);归母净利润增速实现双位数增长的有青岛银行(21.66%)、枣庄银行(15.44%)、齐鲁银行(14.58%);利息净收入实现两位数增长的有枣庄银行(43.04%)、烟台银行(32.92%)、潍坊银行(18.93%);中收占比较高的有青岛银行(10.0%)、恒丰银行(9.5%)、齐鲁银行(9.1%) [16][17] - 资产质量:不良率控制在1%以内的有菏泽农商行(0.92%)、青岛银行(0.97%)、烟台银行(1.00%);逾期率较低的有齐鲁银行(0.88%)、潍坊银行(1.18%)、青岛银行(1.20%);拨备覆盖率显著超行业平均水平的有菏泽农商行(634.23%)、烟台银行(396.83%)、济宁银行(370.08%)、齐鲁银行(355.91%) [17] - 资本充足情况:核心一级资本充足率超过11%的有蓝海银行(14.57%)、菏泽农商行(13.89%)、齐鲁银行(11.61%);核心一级资本充足率低于8.5%的有烟台农商行(8.31%)、日照银行(8.44%)、东营银行(8.46%) [17]
突破长上下文瓶颈:72GB桌面端显卡加持下的智能体效能评测
AI科技大本营· 2026-07-22 10:19
AI行业趋势:从聊天到智能体 - AI行业正从“聊天时代”迈向“多模态、长上下文、深度推理的Agent智能体时代”,未来的AI将能够调用工具、理解复杂任务、保持长期记忆并自主执行多步骤推理[1] - 这一趋势正在重塑AI基础设施需求,包括对百万级Token长上下文处理、多智能体协同、RAG知识库检索及多模态推理的支持[1] - 相较于单纯的计算性能,显存容量与显存带宽正成为本地AI部署的关键瓶颈[1] 硬件测试平台与选型 - 测试选用Dell Precision 7960 Tower旗舰塔式工作站作为硬件平台,其支持从单卡到四卡双宽GPU的性能验证,内存最大可扩展至4TB DDR5,以保障大参数模型的稳定加载与执行[6] - GPU选用NVIDIA Blackwell架构的顶级专业显卡NVIDIA RTX PRO™ 5000 Blackwell (72GB),该卡采用第五代Tensor Core并引入FP4精度,旨在提升大模型推理效率[7] - Blackwell架构通过PCIe 5.0提升CPU与GPU间数据吞吐,GDDR7显存提供超高带宽,显存容量的增加使得桌面端显卡能承载更大规模的推理任务[7] - 在测试平台上,通过搭载单卡、双卡和四卡配置,可分别获得72GB、144GB、288GB的GPU显存容量,以适配不同模型与智能体场景[9] 测试模型与方法论 - 测试选择了不同规模大小的模型,以综合考虑任务复杂度、响应速度、效率与并发等需求[10] - 测试采用原生模型精度作为基准,未进行额外后训练或微调,以反映模型在真实场景下的表现[11] - 软件环境包括NVIDIA Driver 580.x+、CUDA Toolkit 12.8+、vLLM 0.20.0+及PyTorch 2.10[14] - 测试选用三类梯度场景:短对话(4K输入/200输出)、智能体任务(20K输入/200输出)和超长上下文(40K输入/200输出),以覆盖从基础交互到极限生产力的场景[14][17] - 核心测试指标包括首字延迟(TTFT)、P50吞吐率(1/ITL,即平均每用户每秒生成Token数)和总吞吐率(系统总吞吐率峰值)[17] 模型性能实测:以DeepSeek-V4为例 - DeepSeek V4 Flash-284B-NVFP4模型参数量为284B,精度为NVFP4,加载全部参数至少需占用160GB显存,测试使用四卡NVIDIA RTX PRO™ 5000 Blackwell(总显存288GB)支持其运行[19] - **短对话场景(4K输入+200输出)**:随着并发数从1增至64,首字时延从1.724秒增至64.879秒,P50吞吐率从35.71 token/s降至9.62 token/s,总吞吐率从36 token/s增至633 token/s[20]。性能分析指出,四卡配置可较好支持该场景下8-16个并发[26] - **智能体任务场景(20K输入+200输出)**:随着并发数从1增至32,首字时延从10.944秒增至198.152秒,P50吞吐率从33.33 token/s降至14.08 token/s,总吞吐率从33 token/s增至479 token/s[27]。在该场景中,更关注吞吐率,四卡配置下并发在8-16之间体验良好[32] - **超长上下文场景(40K输入+200输出)**:随着并发数从1增至16,首字时延从26.262秒增至228.136秒,P50吞吐率从31.25 token/s降至18.52 token/s,总吞吐率从32 token/s降至297 token/s[31]。性能分析指出,四卡配置可支持4-8个并发,考虑到KV cache,保守估计可支持10个用户[36] 多模型综合性能与硬件适配建议 - 测试涵盖了包括DeepSeek V4、NVIDIA Nemotron-120B、MiniMax M2.5-235B、Qwen3.5-122B、Qwen3.6系列及Gemma4系列在内的多个模型,并整理了相应的模型使用推荐及硬件适配建议[35][37] - 硬件适配建议根据模型规模与场景需求,从单卡到四卡NVIDIA RTX PRO™ 5000 Blackwell (72GB)不等,例如Qwen3.6-27B/35B模型建议使用双卡配置,而Gemma4-26B模型建议使用单卡配置[37] 性能优化实践:NVFP4精度 - Blackwell架构支持NVFP4精度,相比FP8可将模型权重显存占用减少约75%,有效支撑翻倍的上下文长度或批处理大小,对长上下文处理为核心的应用价值突出[39] - 对Qwen3.6-35B-A3B模型的测试显示,NVFP4相比FP16,首字时延降低约18-20%,最高吞吐量在中高并发(8-64)区间提升显著,约为22%-45%,综合性能提升20%-45%[46] - 对Gemma-4-26B-A4B模型的测试显示,NVFP4相比FP16的首字时延降低约22-35%(长上下文场景降幅超34%),最高吞吐量提高显著,综合性能提升约为40%-130%[51] - 结论认为,在Blackwell平台上,NVFP4精度能大幅提升Agent应用的长上下文处理效率,可作为推理任务的优选方案[51] 性能优化实践:KV Cache TurboQuant - 采用NVIDIA TurboQuant KV Cache量化方案,针对Qwen 3.6-35B-A3B模型进行测试[52] - 测试发现,TurboQuant主要优化Prefill阶段性能,能一定程度降低首字时延,在智能体任务与超长上下文场景中增益明显[58] - 但在高并发场景下会带来吞吐率下降,建议将并发控制在32以内以获得最佳性能[58] 性能优化实践:多令牌预测(MTP) - 采用Qwen 3.6-27B模型测试Multi-Token-Prediction (MTP)方法[59] - MTP在轻负载下是提速利器,在低并发场景(如短对话和智能体任务,并发数在8以内)开启MTP可获得12%-60%的吞吐率提升[63] - 在重负载场景或超高并发情况下,则建议关闭MTP[63] 硬件系统综合评估 - Dell Precision 7960工作站搭配NVIDIA RTX PRO™ 5000 Blackwell (72GB)展现了强大的智能体推理能力,能突破超长上下文性能瓶颈,且并发性能出色[64] - 系统在GPU满载情况下,机器噪音可控制在50分贝以内,显卡温度保持在85度,实现办公室静音运行[65] - 该配置性价比具有吸引力,支持从单卡轻量起步到四卡超大模型的灵活配置,便于开发团队在桌面端部署顶级模型以推动Agent应用开发[65]