跳到正文

#实践与教程

今日 47 条
9月25日周五
  1. ZDNET63

    Okta 牵头的联盟呼吁为 AI 智能体设置“紧急停止开关”

    Okta、Google、AWS 和 Salesforce 等公司成立 Blueprint Alliance,并提出让企业掌握 AI 智能体位置、权限、行为及响应方式。联盟发布六项运营原则,要求每个智能体具备可立即暂停或终止运行、并能明确恢复功能的“紧急停止开关”;Okta 展示的方案通过撤销 OAuth 令牌,在数秒内取消智能体对 Salesforce 的访问并通知负责人。

  2. Microsoft Security Blog78

    Microsoft Threat Intelligence 追踪勒索软件附属组织 Storm-2570 的跨部署攻击手法

    Microsoft Threat Intelligence 观察到勒索软件附属组织 Storm-2570 在 Qilin、DragonForce、Anubis 和 BERT 部署中持续使用相似的入侵手法、工具和基础设施。

    推荐理由:文章基于多起入侵调查,梳理了跨勒索软件生态反复出现的工具、基础设施和行为,并提供检测、狩猎查询与防护建议,适合安全团队建立持续追踪和事件响应基线。

9月24日周四
  1. NVIDIA Developer Blog13

    生物基础模型的高效 MoE 训练

    生物基础模型采用 Mixture-of-experts(MoE)架构进行高效训练,通过让每个 token 仅激活一部分专家子网络来扩展模型。随着模型规模增长,稠密 Transformer 中每个 token 都会经过所有层,增加能力会同步提高训练和推理的计算成本。

  2. Elastic Blog71

    Elastic 用原子化声明核验降低 LLM 幻觉风险

    Elastic 介绍如何用原子化声明检查降低 LLM 合并知识库文章时的幻觉和遗漏风险。其流程先合并两篇文档,再针对每篇来源单独提取事实、步骤、版本和指令,生成覆盖表与冲突记录,最后由工程师处理缺失、部分匹配和冲突。该方法以三次模型调用和两张表为核心,并保留人工最终编辑。

  3. NVIDIA Developer Blog25

    AI 工作负载运行前验证 GPU 集群就绪状态

    GPU 集群即使通过全部健康检查,也可能无法正常运行 AI 工作负载。即使 GPU、网络链路和 pod 均显示正常,512-GPU 训练作业仍可能性能不足或失败。单颗 GPU 变慢、链路在负载下退化或配置将流量导向较慢路径,都可能使问题延迟至作业启动数小时后才被发现。

  4. NVIDIA Developer Blog26

    使用 NodeWright 管理 Kubernetes 节点舰队

    NodeWright 用于管理 Kubernetes 节点舰队,覆盖内核设置、系统软件包、存储布局、安全代理及 GPU 工作负载所需的主机调优。Kubernetes 负责节点上运行的工作负载,而团队通常通过 Ansible playbook、自定义脚本和手动运行手册管理节点本身。

  5. Simon Willison21

    Shadow roots:交互示例解析

    Shadow roots 工具通过交互示例讲解 Shadow DOM,涵盖样式封装、继承、slots、parts 和 JavaScript 访问。内容说明 shadow roots 可创建隔离的 DOM 树,使用私有样式表和元素,并以特定、受控的方式与页面 DOM 交互;任务要求 Fable 5.1 Medium 构建相关 artifact。

9月23日周三
  1. Ubuntu Blog72

    使用Charmed Kubeflow与Feast微调并部署自定义LLM

    文章提供使用Canonical Charmed Kubeflow和Feast微调自定义LLM的端到端教程,目标是构建可通过OpenAI-like REST API聊天的模型服务。

    推荐理由:文章提供从环境搭建、数据摄取、特征注册、LoRA微调到KServe部署与对话测试的完整流程,并明确硬件、权限和持久化要求,适合希望在小规模Kubernetes环境中验证自定义LLM流程的读者。

  2. GitHub Blog65

    GitHub用户寻求更高效的软件:调查需求与Daily Efficiency Improver实践

    GitHub与Yale Program on Climate Change Communication调查了1,039名GitHub用户,80%希望使用工具编写更节能的代码,78%希望学习降低软件环境影响的最佳实践,74%希望衡量软件或开发过程的环境影响。

    推荐理由:文章结合1,039名GitHub用户调查与可复现工作流,说明如何寻找代码、数据、网络和前端浪费,并用基准、测试及草稿Pull Request让维护者审核效率改进。

  3. Machine Learning Mastery65

    领域适配中如何选择RAG与微调

    RAG通过在推理时检索外部文档补充知识,微调则通过训练权重改变模型行为,两类技术解决不同问题。文中提供基于TF-IDF、余弦相似度和Anthropic API的RAG管道,以及使用LoRA进行投诉分类结构化输出的微调示例,并给出六点选择框架:RAG适合变化或庞大的知识、来源追溯和快速上线,微调适合稳定遵循特定语气、结构或词汇。

  4. CISA Cybersecurity Advisories70

    FBI与CISA发布关键基础设施与第三方ICS集成商合作安全指南

    FBI与CISA发布事实清单,指导关键基础设施运营方在与第三方工业控制系统(ICS)集成商合作时降低供应链、数据和远程访问风险。文件建议运营方审查集成商的数据存储地点、远程访问能力、设备互联网暴露情况及独立运行能力,并在合同中纳入网络安全、变更管理和补丁管理要求。指南还建议监控远程访问、获取软硬件清单,并维护安全离线备份。

    推荐理由:围绕第三方ICS集成商带来的供应链、数据存储、远程访问和地缘风险,提供合同条款、风险评估、设备审查、访问监控及离线备份等可执行控制措施。

  5. Ubuntu Blog40

    Anbox Cloud如何以共享容量扩展Android开发工作负载

    Anbox Cloud通过共享基础设施按需提供Android环境,减少工程团队对固定手机、开发板和硬件台的依赖。团队可按工作流请求预定义镜像、配置和资源配置,并在任务完成后释放实例;容器适合应用级测试、串流、自动化和游戏,虚拟机适合需要完整Android系统及系统级验证的工作负载。

  6. Fedora Magazine72

    在 Fedora 45 上使用 Stratis 配置本地存储

    Fedora 45 的 Anaconda 图形安装器新增 Stratis 存储配置支持,用户可通过 Cockpit 存储模块创建存储池和文件系统。文章还介绍使用 Kickstart 的 autopart、stratispool 和 stratisfs 配置自动或手动 Stratis 布局;Anaconda 暂不支持缓存和无口令加密,但可在安装后启用。

    推荐理由:文章提供 Fedora 45 使用 Stratis 的图形化与 Kickstart 安装步骤,涵盖存储池、文件系统、加密及超额配置,适合需要规划本地存储布局的 Linux 用户。

  7. Redis Blog65

    Redis 为 Python 应用提供跨区域故障切换的 MultiDBClient

    Redis Blog 介绍 MultiDBClient 如何为 Python 应用管理 Active-Active Redis 的区域端点健康检查、加权选择、故障切换、重试与自动回切。Active-Active Redis 使用 CRDT 处理并发更新并最终收敛,MultiDBClient 则通过健康检查和 FailureDetector 识别异常,但不会广播命令或复制数据。

    推荐理由:文章系统说明 MultiDBClient 的加权端点选择、主动健康检查、熔断、重试、自动回切与可观测性,并讨论不同工作负载下的参数取舍,适合需要设计 Python 应用跨区域故障切换机制的团队参考。

  8. Redis Blog76

    从 Azure Cache for Redis 迁移至 Azure Managed Redis 的成本分析

    在 East US 2、目标配置满足容量与性能需求的四组 Premium 至 Balanced 比较中,Azure Managed Redis 的月度服务成本降低约 43%–44%。文章以 P3 迁移至 B20 的示例估算,5,000 美元迁移预算约在第 8 个月回本;同时提醒按实际商业条款、迁移工作、额外功能及区域部署核算完整成本,并关注 ACR 退役日期。

    推荐理由:基于公开价格与示例迁移预算,量化不同工作负载的月度成本、回收期及容量前提,并列出测试、迁移与总拥有成本核对项,适合小团队评估迁移决策。

9月22日周二
  1. Raspberry Pi News73

    使用14MB函数调用模型Needle将文本转换为Raspberry Pi本地操作

    Cactus Compute 展示了 Needle 2 如何在 Raspberry Pi 5 仅使用 CPU 将英文指令转换为本地 Python 操作。示例中“Turn the LED on”在 78 毫秒后点亮 LED,完整进程占用峰值 43MB 至 46.4MB;模型权重和代码以 Apache 2.0 许可发布。

    推荐理由:文章提供可复现的 Raspberry Pi 5 CPU 端函数调用示例、Python 接口和性能数据,能帮助开发者评估小模型执行本地工具调用的可行性。

  2. GitLab Blog67

    如何为企业规模设计 GitLab 架构

    GitLab 指南从部署模型、Runner 策略、高可用与灾难恢复、规模性能和 Kubernetes 架构等方面,说明企业扩展前应做的架构决策。平台团队可依据任务量、并发、隔离要求和 SLO、RTO、RPO 目标规划容量,并通过真实负载测试和检查清单持续验证设计。

    推荐理由:提供部署模型、Runner容量、高可用、性能与Kubernetes架构的系统规划方法及上线检查清单,适合平台团队评估规模化运维责任与扩展条件。

  3. NVIDIA Developer Blog46

    如何从工具调用到任务完成评估 AI Agent

    评估 AI Agent 的关键,是观察其能否在实时环境中完成由数十次连续工具调用组成的工作,并在某一步失败后恢复。判断模型回答听起来是否合理,几乎无法说明任务是否真正完成,因此 Agent 评估需要从单次函数调用评分转向对完整任务的评估。

9月21日周一
  1. NVIDIA Blog53

    如何解决 AI 智能体技术栈各层的安全工程问题

    AI 智能体安全需要覆盖完整技术栈,以可执行边界、明确责任人和防护有效性证据约束模型、harness 与运行环境。文章建议配置受限身份和凭据、沙箱、访问策略、人工审批、受保护日志及事故处置流程,并在模型、工具或工作流发生重大变化后重复安全测试。文中还将 NVIDIA OpenShell 描述为在智能体权限之外执行策略并提供沙箱运行的开源安全运行时。

  2. Machine Learning Mastery67

    LLM 推理优化掌握路线

    本文提供一套 LLM 推理优化路线,围绕 prefill 与 decode 的性能差异,系统介绍 KV caching、PagedAttention、批处理、注意力优化、模型压缩、推测解码和多 GPU 并行化。文章强调,应根据延迟、吞吐、上下文长度和硬件预算,对实际工作负载进行 profiling 后选择优化技术。

9月19日周六
9月18日周五
  1. Machine Learning Mastery67

    用 Python 和 NumPy 从零构建并理解向量数据库

    本文通过 Python 和 NumPy,用十个步骤构建并解释一个基础向量数据库。内容涵盖文档向量化、基于余弦相似度的语义搜索、元数据过滤、输入校验、索引保存与加载,以及暴力搜索随语料规模增长的成本。教程还演示了 HNSW、IVF 等近似索引的适用扩展方向。

  2. GitLab Blog66

    GitLab:以机器速度守护软件工厂

    GitLab提出面向代理式软件开发的机器速度安全框架,覆盖攻击面发现、基础控制强化和已发布软件持续防护。框架要求将安全策略置于执行路径,为代理设置可追溯身份与受限权限,并以从检测到经验证修复的时间为核心指标。

    推荐理由:文章以GitLab实践为依据,提出覆盖发现、基础控制和上线后持续防护的三层方法,并强调以检测至经验证修复时间衡量成效,适合安全与工程团队设计治理流程。

  3. Elastic Blog36

    SNAP付款错误检测:Elastic如何帮助美国各州应对FY2028处罚

    Elastic提出以同一平台实时检测SNAP付款错误,帮助美国各州在FY2028财政年度前应对州政府分担福利成本的风险。平台通过可定制规则、无监督与有监督机器学习及Elastic Agent Builder调查案例,识别收入超限、行为漂移和异常活动。自FY2028起,错误率达到6%及10%的州将分别承担相应份额的福利成本。

  4. 异次元软件世界52

    微软 Project Zenith 开发者优化版 Windows 11 与官方开源配置脚本

    微软发布 Project Zenith 开发者优化版 Windows 11 定位,配套设备预装开发工具并调整系统设置,但目前未提供该版本的 ISO 镜像。文章介绍通过 Microsoft 的 WindowsDeveloperConfig 开源项目,将标准 Windows 11 配置为类似 Zenith 的开发环境;本地运行 300 亿参数以上模型仍取决于硬件。

9月17日周四
  1. Ubuntu Blog36

    Android 开发为何不应从实体设备起步:Anbox Cloud 的按需环境模式

    Anbox Cloud 将完整 Android 系统作为托管容器或虚拟机运行,使开发、测试、调试和串流可从按需配置的环境开始。团队可通过 Anbox Management Client、AMS HTTP API 或 SDK,以代码管理实例的请求、配置、访问、结果收集与释放,并接入 CI 系统。该模式减少对专用设备和本地模拟器的依赖,但最终产品相关的目标硬件验证仍不可替代。

  2. OpenAI News64

    OpenAI发布模型失准报告框架及六份行为报告

    OpenAI发布模型失准报告框架,用于跟踪、调查和披露模型失准。OpenAI同时公布六份报告,记录模型出现的意外或令人担忧的行为。

    推荐理由:OpenAI同步提供模型失准的跟踪、调查与披露框架及六份异常行为报告,有助于理解其模型安全事件的报告路径与公开材料范围。

9月16日周三
  1. Smashing Magazine45

    别再把 CSS 容器查询当作传统媒体查询使用

    CSS 容器查询应根据组件所在容器的可用空间调整布局,而非像媒体查询那样只判断视口尺寸。其浏览器支持率约为 94%,但《State of CSS》调查显示,86% 的开发者了解该功能,实际使用者仅占 41.4%。容器尺寸查询可让组件在不同上下文中独立响应宽度变化,而实验性的容器样式查询则用于响应容器的计算样式。