登録して招待リンクを共有すると、動画再生報酬と紹介報酬を獲得できます。

検索結果 DataAI
DataAI コミュニティ
1つのキーワードが1つのコミュニティです。
コミュニティ作成
アカウント
見つかりません
DataAI を含む検索結果
# Neo4jの機能と実践的な使い方 🚪 データ投入の方法選びを最初に間違えると、後工程がすべて遅くなります。Neo4jの「インポート方法 選択ガイド」は、規模と頻度から最適な入口を決めるためのハブページです。 🏷️ タイトル: インポート方法の選択ガイド 🔗 URL: 📘 概要 Neo4jへのデータ投入には複数の手段があり、それぞれ得意な規模・実行モード(オンライン/オフライン)・権限要件が異なります。このページは個別の手順書ではなく、「どの方法を選ぶべきか」を最初に判断するための入口にあたります。 ⚙️ 機能の説明 主な選択肢は次のとおりです。 ・Data Importer: ブラウザGUIでCSVをドラッグ&ドロップし、ノード/リレーションシップに視覚的にマッピング。Cypher不要で、検証・プロトタイピング向き。 ・`LOAD CSV`: Cypherで書く汎用的な取り込み。オンライン(DB稼働中)で動き、非管理者でも実行可能。数十万〜数百万行クラスまで。 ・`neo4j-admin database import`: オフラインのバルクローダ。空のDBに対し、ストアファイルへ直接書き込むため最速。数十億規模の初期構築向け。 ・コネクタ/APOC: Apache Spark / Kafka / CDC による継続的同期や、JSON/XML/XLSなど多様な形式の取り込み。 🛠️ 実践的な使い方 規模と頻度で入口を決めるのが実践の第一歩です。 ・数千件のマスタを手早く → Data Importer(GUI) ・数百万件の定期ロード/差分ロード → `LOAD CSV`(`MERGE`で冪等化) ・数十億件のワンショット初期構築 → `neo4j-admin database import`(オフライン) ・常時の継続同期 → Kafka / CDC / Spark コネクタ いずれの経路でも、取り込み前にキー列へ一意制約を張るのが共通の定石です。 ```cypher CREATE CONSTRAINT person_id IF NOT EXISTS FOR (p:Person) REQUIRE IS UNIQUE; ``` 💡 ユースケース プロジェクト初期に、PoCはData Importer、本番初期構築は`neo4j-admin import`、日次差分は`LOAD CSV`、というように経路を分けて設計します。これにより「検証は軽く速く、本番投入は最速」を両立できます。 ⚠️ 注意点 ・`neo4j-admin import`は空のDB専用かつオフラインのため、稼働中DBには使えません。 ・`LOAD CSV`は行数が数十万〜数百万に近づくとメモリ問題が出やすく、`CALL { } IN TRANSACTIONS`での分割が必要です。 ・継続同期(Kafka/CDC)は初期ロードとは別物として、組み合わせて設計します。 ・このページは入口です。各方式の細部は必ずリンク先の個別ドキュメントで確認してください。 #Neo4j# #DataImport#
もっと見る
# Palantir Foundryを学ぶ 🚀 「このダッシュボードの数字、どこから来たの?」に即答できる。Data Lineageは、データの流れをまるごと可視化する探索ツールです。 📌 タイトルと機能のURL タイトル: データリネージ URL: 📝 概要 Data Lineageは、Foundryプラットフォーム上をデータがどう流れるかを包括的に示すインタラクティブな可視化ツールです。データの移動・依存関係・変換を、データエコシステム全体にわたって理解できます。ソースからパイプライン、オントロジー、アプリへと続く系譜をグラフとして辿れるため、障害対応や監査説明のコストを大きく下げられます。 🔧 機能の説明 グラフベースのビジュアライゼーションでデータの依存関係を表現します。 ・プロジェクト名・テーブル識別子・行ラベルを使ってデータセットを検索でき、Foundry Projects上から直接データを閲覧できます ・任意のデータセットについて、上流(祖先)と下流(子孫)の関係を展開・折りたたみできます ・複数のテーブル属性を同時に表示し、スキーマ詳細・ビルドのタイムスタンプ・ソースコードまで確認できます ・カスタムのカラースキームを適用して、古くなった(stale)データセットなどパイプラインの特性を強調できます ・共有可能なパイプラインのスナップショットを作成し、チーム内で共有できます 🛠 実践的な使い方 ・ダッシュボードや出力データセットから上流をたどり、数字の出所(ソース)を特定します ・上流のスキーマ変更があった際に、下流をたどって影響範囲を洗い出します ・カラースキームで古いデータセットを色分けし、放置されたパイプラインを発見します ・高レベルの全体像から、変換コードや実行履歴といった粒度の細かい技術詳細へドリルダウンします ・パイプラインのスナップショットを共有してデータワークフローを部門横断で文書化します 🎯 ユースケース ・「このダッシュボードの数字の出所」を即座に回答 ・上流スキーマ変更の影響範囲を事前に特定し、障害を未然に防止 ・監査時にデータの系譜を提示して説明コストを削減 ・古い・未使用のデータセットを発見してパイプラインを整理 ⚠️ 注意点 ・本概要ページでは、極端に大規模なパイプラインでのパフォーマンスやグラフの複雑さに関する制約は明示されていません ・リネージはFoundryプラットフォーム内のデータフローを対象とし、プラットフォーム外の処理は可視化の範囲外となります ・系譜の正確さは、変換やパイプラインがFoundry上で適切に構成されていることに依存します #PalantirFoundry# #DataLineage#
もっと見る
# OpenAI Agent SDKの便利で実践的な使い方 🌍 ツールの入出力にもガードレールを設定して、セキュリティを強化しましょう! ツール引数のチェックや出力のマスキングで、機密情報の漏洩や不正な操作を防止できます。 📌 タイトル:Guardrails – Tool guardrails 🔗 URL: 🧩 概要 Tool guardrailsは、ツールの実行前(引数チェック)と実行後(出力チェック)にガードレールを設定する仕組みです。APIキーの混入防止、機密データのマスキング、特定の操作のブロックなど、ツールレベルでのセキュリティ制御を実現します。マネージャーパターンやHandoff、委任を使う複雑なワークフローでも、個別のツールに対してきめ細かいチェックを適用できます。 🛠 使い方 `agents`から`Agent`, `function_tool`をインポートします。`@function_tool`デコレータでツール関数`search_api(query: str) -> str`を定義し、`Agent(name="SecureAgent", tools=[search_api], tool_guardrails=[check_tool_args])`のように`tool_guardrails`にチェック関数を設定します。 🏗 実践的な使い方 **APIキーの混入をブロック(reject_content)** ツール引数に`sk-`で始まるAPIキーが含まれていないかチェックし、検出時にツール実行をブロックします。 `re`と`GuardrailFunctionOutput`をインポートし、`reject_api_keys(context, agent, tool_call)`関数で` str(tool_call.arguments))`によりAPIキーの混入を検出します。`tripwire_triggered=has_api_key`で検出時にブロックし、`Agent(name="SecureAgent", tools=[search_api, call_external_service], tool_guardrails=[reject_api_keys])`として設定します。 **ツール出力の機密データマスキング** ツール実行後の出力に含まれる機密情報(メールアドレス、電話番号など)を自動的にマスキングします。 `mask_sensitive_output(context, agent, tool_call, tool_output)`関数でツール出力に対して`re.sub(r'[\w.+-]+@[\w-]+\.[\w.]+', '[MASKED_EMAIL]', str(tool_output))`でメールアドレスを、`re.sub(r'\d{3}-\d{4}-\d{4}', '[MASKED_PHONE]', masked)`で電話番号をマスキングします。`GuardrailFunctionOutput(output_info={"masked": True}, tripwire_triggered=False, modified_output=masked)`で加工済み出力を返し、`Agent(name="DataAgent", tools=[query_customer_db], tool_guardrails=[mask_sensitive_output])`として設定します。 **複雑なワークフローでの個別ツールチェック** マネージャーパターンやHandoff、委任を組み合わせた複雑なワークフローでも、特定のツールに対してきめ細かいガードレールを適用できます。 `check_delete_permission(context, agent, tool_call)`関数で` == "delete_record"`の場合に`context.get("user_role", "viewer")`で権限を確認し、`user_role not in ["admin", "editor"]`なら`tripwire_triggered=True`でブロックします。それ以外のツールは`tripwire_triggered=False`でスキップします。`Agent(name="Manager", tools=[query_db, update_record, delete_record], tool_guardrails=[check_delete_permission, reject_api_keys])`のように複数のガードレールを組み合わせて設定できます。 💡 ユースケース 🔑 ツール引数へのAPIキー・シークレット混入防止 🎭 ツール出力からのPII(個人情報)自動マスキング 🚫 権限に基づく特定ツール操作のブロック 🔒 複雑なマルチエージェントワークフローでのセキュリティ制御 ⚠️ 注意点 - ツールガードレールはツールの実行ごとに呼び出されるため、パフォーマンスへの影響を考慮してください - 正規表現によるチェックは完全ではありません。重要なセキュリティ要件には複数の防御層を設けてください - マスキング処理は元のデータ型を変更する可能性があるため、後続の処理に影響がないか確認してください - 複数のツールガードレールを設定した場合、すべてが順に実行されます ✨ ツールガードレールで、エージェントのツール操作をきめ細かく制御し、セキュリティを強化しましょう! #OpenAIAgentSDK# #AIAgent#
もっと見る
# Palantir Foundryを学ぶ 🚀 「閉域網のオンプレOracleやSAPに、ファイアウォールに穴を開けずどう繋ぐ?」エンタープライズ導入の最初の関門を突破するのがData Connectionです。 📌 タイトルと機能のURL タイトル: Data Connection URL: 📝 概要 Data Connectionは、外部システムのデータをFoundryに同期し、データ統合・モデリング・オントロジーの各レイヤーで利用できるようにするアプリケーションです。Webhookやデータエクスポートによる外部システムへの書き戻し(アウトバウンド)にも対応します。多数のソースタイプに対応し、認証・スケジュール・監視といった煩雑な部分を抽象化して、シンプルな画面からパイプラインを構成できます。 🔧 機能の説明 Foundryのデータ接続は、3つの原則に沿って標準化されています。 ・堅牢性: 自動リトライ、小さなバッチ単位での処理、ヘルス監視による障害警告を備えます。データは「最も原始的なソースからそのまま(as-is)」取り込み、Foundryのバージョン管理されたパイプラインを唯一の正(single source of truth)とすることで、外部前処理に依存しません ・拡張性: データベース、FTPS、HDFS、S3、SFTPなどの標準連携に加え、新しいソースタイプにも対応できます。スケジューリングやオーケストレーションといった中核機能は標準化されているため、接続固有の調整だけで済みます ・使いやすさ: 複雑さを抽象化し、認証・スケジュール・監視を手作業で管理する代わりに、シンプルなインターフェースで構成できます ・主要な構成要素として、エージェントのセットアップ、ソース構成、バッチ/ストリーミングの同期、Webhook、エクスポートを備えます 🛠 実践的な使い方 ・ワークスペースのナビゲーションまたはアプリケーションポータルからData Connectionにアクセスします ・接続先(ソース)を構成し、バッチまたはストリーミングの同期(sync)を設定して、データを「そのまま」取り込みます ・取り込み後の変換はFoundry側のパイプラインに集約し、ソース側では前処理を行わないようにします ・書き戻しが必要な場合は、Webhookやエクスポートでアウトバウンド連携を構成します 🎯 ユースケース ・閉域網のオンプレOracle/SAPを、エージェント方式(アウトバウンドのみで成立)でFW穴あけなしに接続 ・データベース・SFTP・S3など多様なソースからの定期バッチ取り込み ・処理結果を外部システムへ書き戻すアウトバウンド連携 ⚠️ 注意点 ・データはソースから「as-is」で取り込み、変換はFoundryのパイプラインに寄せる設計が前提です。ソース側で加工すると追跡性が損なわれます ・エージェントやソースの構成には、ネットワーク・認証の適切な準備が必要です ・X APIなど外部サービスの上限や規約は仮定せず、接続先ごとの制約を事前に確認してください #PalantirFoundry# #DataIntegration#
もっと見る
🏗 毎日数ペタバイトを取り込む数万件のジョブを、データ提供を一切止めずに丸ごと移行する——。Metaが「シャドウ→逆シャドウ→クリーンアップ」の3段階でレガシーを100%廃止した実戦記です。 タイトル: Migrating Data Ingestion Systems at Meta Scale URL: 📝 概要 Metaは世界最大級のMySQL展開から、毎日数ペタバイトのソーシャルグラフデータをデータウェアハウスへ増分取り込みしています。本記事は、その数万件の取り込みジョブを、分析・レポーティング・MLの各パイプラインを止めずに、新しいセルフマネージド型サービスへ移行した方法を解説します。 ❓ 解決する課題 レガシーは顧客(チーム)所有のパイプラインで、小規模では有効でもハイパースケールで不安定でした。ますます厳しくなるデータ到着時刻の要求を満たしつつ、組織全体へのデータ提供を止めずに移行する必要がありました。 💡 方法論と提案手法 3フェーズのライフサイクルで移行します。 ・シャドウ:本番前環境で本番データを消費しつつ隔離テーブルへ書き込み、本番ジョブとの行数・チェックサムの不一致を継続監視します ・逆シャドウ:シャドウジョブを本番テーブルへ昇格させ、元の本番ジョブをシャドウへ。両系統の出力を比較し続けて品質シグナルを得つつ、必要なら即ロールバックします ・クリーンアップ:整合性を確認後、旧ジョブを廃止します ・各ジョブを、差異ゼロ・ランディング遅延・リソース・カスタム基準の4軸で検証し、CDC(変更データキャプチャ)でフルダンプ・デルタ・ターゲットの各テーブルを保持します 🎯 ユースケース 大規模なデータ取り込み基盤の移行、CDCパイプラインの段階的な切り替え、ゼロダウンタイムでのシステム置換の設計に役立ちます。 📊 実績 ・ワークロードの100%を移行し、レガシーシステムを完全に廃止しました ・ジョブの状態シグナルをScubaへ継続送信し、各ジョブを監視してステージ間で自動昇格/降格する移行ツールで、数千件の同時移行を管理しました ・不良パーティションをメタデータでフラグし、下流ジョブへの伝播を防いでアラートを発火させました ・移行容量の制約に対し、旧システムが配信したスナップショットを初期値に再利用してフルダンプ負荷を削減し、生まれたデータ品質解析ツールは移行後もリリース検証で使われ続けています #DataEngineering# #DataInfrastructure#
もっと見る
⚡ 数十億件の集計を、クエリの先頭に1行足すだけで最大100倍速く。しかも統計的に厳密な信頼区間付き——Elasticsearch ES|QLの近似クエリです。 タイトル: Approximate queries in Elasticsearch ES|QL: 100x faster on billions of records, with built-in confidence intervals URL: 📝 概要 Elasticsearch 9.4は、ES|QLに近似クエリ実行を導入します。既存クエリの先頭にSET approximation = true;を付けるだけで、自動的なサンプリングと外挿が有効になり、クエリの書き換えは不要です。 ❓ 解決する課題 数十億ドキュメントの厳密な集計は、計算コストが行数に比例して増えるため高コストでした。これが大規模インデックスでのインタラクティブな探索やリアルタイムダッシュボードの妨げになっていました。 💡 方法論と提案手法 ・サンプリングはLucene層で行われ、サンプル分のドキュメントだけを読むため、I/Oと計算の節約はサンプリング率に比例します ・サンプル上で実行した結果を、データセット全体を表すよう自動でスケールします ・信頼区間はサンプルのサブパーティションへのブートストラップ法で厳密に計算します ・各結果に「certifiedフラグ」が付き、形式的な統計保証が成り立つかを示します 🎯 ユースケース エージェントが数十億件をサブ秒で走査して候補を絞り、必要な箇所だけ厳密クエリへズームインする、といった使い方ができます。ダッシュボードの高速描画や巨大ログのパターン検出にも有効です。 📊 実験結果 ・ClickBenchで信頼区間付き平均23倍、個別クエリのピークは約100倍、区間計算なしでは最大約300倍 ・サンプリングコストは一定なので、データが大きいほど高速化率も大きくなります ・対応集計はCOUNT/SUM/AVG/MEDIAN/PERCENTILE/STD_DEVなど。rowsとconfidence_levelで精度と速度を調整できます #Elasticsearch# #DataAnalytics#
もっと見る